{"as_of":"2026-08-09T10:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:294237ca3dcfdd5e58cbee562b4afcf652e61eb470e256d7cc98d782c5b7a9b0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":33,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:20:08.455261Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T12:09:48.871684Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T05:37:41.401736Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2311.16502"},"observation_digest":"sha256:547925a23fcdf29c56d89f86b929ef485d77cfeeb1b4344dc4725c00dce86951","observation_id":"5aa228ac-1987-4675-bf6f-e0fe34447313","resolution":{"observed_at":"2026-05-15T05:37:41.639085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T00:19:27.965902Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2401.16158"},"observation_digest":"sha256:01fa41dec23eccf711bdacfc04170fea29a454204390a5b2849d74c453c178d0","observation_id":"75b31be1-6db3-41b0-bb1b-15da1e94e251","resolution":{"observed_at":"2026-05-17T00:19:28.026823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:2b278738924ce6f18b6f696177f3ea806a250b6f5ccafa2b417ef6183035bd2c","observation_id":"e62c1d3d-15ac-4a15-ab2e-037fa7173fb2","resolution":{"observed_at":"2026-05-16T04:09:36.503622Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T20:21:57.873354Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2404.16994"},"observation_digest":"sha256:ead2e8267232f95e4270fef10ab9226d0d9255828234da35477243fad799a83e","observation_id":"84ad2ef8-c196-4b86-b7ff-8a212b9abe75","resolution":{"observed_at":"2026-05-15T20:21:57.992998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:825a3a4b1b19621e0721a323bfeb0d51a3051c37a49bca80d7efe55d81f2e434","observation_id":"61e5d36f-238b-4510-8d74-148bc6e0df71","resolution":{"observed_at":"2026-05-10T14:46:36.498450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"reference_index":227,"source":"arxiv_source","source_observed_at":"2026-05-20T06:20:36.235304Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2408.04840"},"observation_digest":"sha256:204783c8dfd9687e8270601389f68085af4d76c769858e982bbecc53d82cfd1e","observation_id":"5a8e2401-59df-4aae-86f0-e0c8011f7464","resolution":{"observed_at":"2026-05-20T06:20:36.442753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T00:32:41.059558Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2501.13826"},"observation_digest":"sha256:e349d9da2e64f7d0362b1a5ede0dfad0707f03478d3aadcf04b92d5def5c624e","observation_id":"588643b7-9054-49ca-8bae-8de9a918f330","resolution":{"observed_at":"2026-05-14T00:32:41.131367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-08T12:20:08.455261Z","title":"Vila: On pre-training for visual language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07855","last_updated":"2025-06-13T12:20:30Z","snapshot_observed_at":"2026-08-08T16:43:44.128026Z","submitted_at":"2025-02-11T14:04:43Z","title":"Vision-Language Models for Edge Networks: A Comprehensive Survey","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-08T12:20:08.455261Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2502.07855"},"observation_digest":"sha256:494a696ef788ba6fb70063c1c47266237400bce69685067f3e2da1af43618b2a","observation_id":"229832af-0b80-48e4-9f71-cbd0c6446fa8","resolution":{"observed_at":"2026-08-08T12:20:08.455261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-07T11:59:53.733092Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00893","last_updated":"2025-08-02T10:06:31Z","snapshot_observed_at":"2026-08-07T12:18:52.747304Z","submitted_at":"2025-06-01T08:26:34Z","title":"Affordance Benchmark for MLLMs","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:53.733092Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2506.00893"},"observation_digest":"sha256:615c76a3af6104be3ede6da07f2ef5f7bbeefc03c2990cc15489a4c5112a61a3","observation_id":"64b238b0-36c6-48f8-a9b6-8fcd4efb3e7f","resolution":{"observed_at":"2026-08-07T11:59:53.733092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T21:22:36.902119Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2506.01844"},"observation_digest":"sha256:40a6533ba95d22f4d2c59216e91c44608f916ccc96a1129ac75b673faba5f3d4","observation_id":"7893db75-165d-4948-a513-86e9cacc1672","resolution":{"observed_at":"2026-05-11T21:22:37.461989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-06T23:57:24.185844Z","title":"arXiv preprint arXiv:2312.07533 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15681","last_updated":"2026-06-25T14:33:27Z","snapshot_observed_at":"2026-08-08T08:54:57.204006Z","submitted_at":"2025-06-18T17:59:49Z","title":"GenRecal: Generation after Recalibration from Large to Small Vision-Language Models","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:24.185844Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2506.15681"},"observation_digest":"sha256:19f9ad4be046f2515251b82d46ea92cad78b5dfdd9a5acfe4a4c8779fba2cc29","observation_id":"bbeed42a-e77b-437f-b766-638f6d431e27","resolution":{"observed_at":"2026-08-06T23:57:24.185844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-06T21:34:45.150075Z","title":"Vila: On pre-training for visual language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23844","last_updated":"2025-06-30T13:34:34Z","snapshot_observed_at":"2026-08-08T15:24:13.507722Z","submitted_at":"2025-06-30T13:34:34Z","title":"A Survey on Autonomy-Induced Security Risks in Large Model-Based Agents","version":1},"reference_index":139,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:45.150075Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2506.23844"},"observation_digest":"sha256:ad8aadaf397792cd288641157061b91130c55b81f255553cd7dcbe3bf2026e63","observation_id":"3c15058f-a19e-4f63-9807-89b51860cc96","resolution":{"observed_at":"2026-08-06T21:34:45.150075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-06T20:29:52.368568Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-07T06:17:01.457380Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:52.368568Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:b8b7872429af2b2725bf641a1d681102b57ddceb0dbc2315a7a811e7f2b9e375","observation_id":"91d85d33-4de6-46c1-9662-ac35ff987eda","resolution":{"observed_at":"2026-08-06T20:29:52.368568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-06T17:22:10.522038Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11102","last_updated":"2025-07-15T08:52:28Z","snapshot_observed_at":"2026-08-09T03:36:22.523976Z","submitted_at":"2025-07-15T08:52:28Z","title":"KptLLM++: Towards Generic Keypoint Comprehension with Large Language Model","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T17:22:10.522038Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2507.11102"},"observation_digest":"sha256:81caf522dd05c285ba0fe661f019a0e182133eb3beb85e8c028d413aa1d0347e","observation_id":"08768bc4-df80-43f8-a3c7-0cdc7de55359","resolution":{"observed_at":"2026-08-06T17:22:10.522038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-06T05:36:18.864386Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:18.864386Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:d226629c511ebb30e49c17dd3c97bf33875d0f500e8e0188f0a9291129c4bf29","observation_id":"5abc18a0-57c1-41e4-9b75-a1c7165fae67","resolution":{"observed_at":"2026-08-06T05:36:18.864386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-04T20:32:56.622377Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.622377Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:a72cd38331c52dc1339d35bbd299552ecc2675f226377e3873f86a1d83636aa6","observation_id":"1354d313-04a2-4e86-a48a-d63ce58b7a6e","resolution":{"observed_at":"2026-08-04T20:32:56.622377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-04T20:20:31.990067Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-07T18:32:51.031712Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.990067Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:dd18240ca0f9558c6240a3634f755d7aa8822df5403796a4abc658af59358426","observation_id":"fb3d657b-2e0a-4e38-abd9-018bed994755","resolution":{"observed_at":"2026-08-04T20:20:31.990067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-04T14:53:17.092139Z","title":"Vila: On pre-training for visual language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22504","last_updated":"2026-05-28T15:39:50Z","snapshot_observed_at":"2026-08-06T22:26:20.796622Z","submitted_at":"2025-09-26T15:46:14Z","title":"Estimating the Empowerment of Language Model Agents","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T14:53:17.092139Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2509.22504"},"observation_digest":"sha256:a53a04333973579ec9d43dfb803cde4937a83e3cd86c9c91320d0be773b9f102","observation_id":"564b90a6-2952-4def-9ddf-883dc07b490e","resolution":{"observed_at":"2026-08-04T14:53:17.092139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-04T09:12:08.258287Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.17045","last_updated":"2026-06-01T07:19:41Z","snapshot_observed_at":"2026-08-04T09:12:02.562884Z","submitted_at":"2025-10-19T23:17:13Z","title":"Video Reasoning without Training","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T09:12:08.258287Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2510.17045"},"observation_digest":"sha256:e14cf1f2c0db63555ca2ab80f7112653e238749939f33a90b40612c6d9d1fc97","observation_id":"1b5e48f3-1ec3-40f7-91cf-92a9edad9b97","resolution":{"observed_at":"2026-08-04T09:12:08.258287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-03T18:42:11.790946Z","title":"Vila: On pre-training for visual language models.arXiv preprint arXiv:2312.07533, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04069","last_updated":"2026-06-01T16:57:23Z","snapshot_observed_at":"2026-08-03T18:42:08.737584Z","submitted_at":"2025-12-03T18:50:04Z","title":"SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T18:42:11.790946Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2512.04069"},"observation_digest":"sha256:f2d73323f99250816b466e68dfd5abb9966ba73a2465ab9484e749aff922e0c2","observation_id":"cfa2b176-0507-42e7-9483-4c2c5a486be4","resolution":{"observed_at":"2026-08-03T18:42:11.790946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:06da575edaa29e4627031cdff99ec3dadba788304e7964aa1f0e34cebbc02cdf","observation_id":"03fd888e-7c74-439c-9582-e6d7ba631392","resolution":{"observed_at":"2026-05-16T12:57:53.836328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2604.09749","last_updated":"2026-04-10T11:01:48Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T11:01:48Z","title":"See Fair, Speak Truth: Equitable Attention Improves Grounding and Reduces Hallucination in Vision-Language Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:51.797197Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2604.09749"},"observation_digest":"sha256:9c5ad1dd48718c20621688c933e2c211ef40785dd172bb5be17b9e7180af2ce3","observation_id":"86d6886c-7282-433f-990e-073e791dc387","resolution":{"observed_at":"2026-05-11T08:26:00.660703Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2604.10985","last_updated":"2026-04-13T04:44:42Z","snapshot_observed_at":"2026-07-06T22:59:27.499664Z","submitted_at":"2026-04-13T04:44:42Z","title":"Back to the Barn with LLAMAs: Evolving Pretrained LLM Backbones in Finetuning Vision Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:13.367863Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2604.10985"},"observation_digest":"sha256:df90d9eeb30447acdaa85c4cc0dc445f135b5c531a4fa2e618084e5ff4a873e0","observation_id":"bf203738-4503-43dc-b8d6-5d69041428fb","resolution":{"observed_at":"2026-05-11T09:20:59.239922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2604.23941","last_updated":"2026-04-27T01:29:02Z","snapshot_observed_at":"2026-08-02T10:14:35.344341Z","submitted_at":"2026-04-27T01:29:02Z","title":"GoClick: Lightweight Element Grounding Model for Autonomous GUI Interaction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T04:46:22.676901Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2604.23941"},"observation_digest":"sha256:3a6aced934b76dea1886b8082d3149d8482c531c17fcd35a0535a8124b9f5ad0","observation_id":"d3678fd2-7160-450c-8434-235fd90be38d","resolution":{"observed_at":"2026-05-11T21:36:17.209504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2605.13328","last_updated":"2026-05-13T10:41:24Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T10:41:24Z","title":"What Limits Vision-and-Language Navigation ?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T17:59:58.891151Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2605.13328"},"observation_digest":"sha256:e83350cd7f77d22bb715c3e3a9ad87b75f2dcee0296d8077c28b9f6f41f8045d","observation_id":"1e138bcd-5b29-4938-bf6d-82a014ab1786","resolution":{"observed_at":"2026-05-14T18:02:32.831408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2605.27318","last_updated":"2026-07-06T17:18:57Z","snapshot_observed_at":"2026-07-12T15:54:07.137141Z","submitted_at":"2026-05-26T17:26:29Z","title":"Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T18:15:28.261185Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2605.27318"},"observation_digest":"sha256:70bef244bfbd3dced3d4d12a4691c1ff708388be6f4c7540c20b8c008ef02be6","observation_id":"49b95122-0aff-4e75-a057-6ad370c89577","resolution":{"observed_at":"2026-06-29T18:23:50.990383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-12T15:54:12.909974Z","title":"VILA : On pre-training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.27318","last_updated":"2026-07-06T17:18:57Z","snapshot_observed_at":"2026-07-12T15:54:07.137141Z","submitted_at":"2026-05-26T17:26:29Z","title":"Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-12T15:54:12.909974Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2605.27318"},"observation_digest":"sha256:b386bfef89da25105ce7de81a22241167b73f7b3f4db04e5ded5607e367f0cfd","observation_id":"8b8304d8-1782-40b8-a388-98484736660b","resolution":{"observed_at":"2026-07-12T15:54:12.909974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2606.17539","last_updated":"2026-06-16T05:32:39Z","snapshot_observed_at":"2026-07-06T23:53:07.149182Z","submitted_at":"2026-06-16T05:32:39Z","title":"Reinforcing Dual-Path Reasoning in Spatial Vision Language Models","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-06-27T01:42:30.005911Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2606.17539"},"observation_digest":"sha256:696f4a2fd4e34aef61a9f204cd5515bf2d14e42cb9216b09862eb11a47a04dbe","observation_id":"118b7e57-d14b-4d7a-8c91-97878b70e66a","resolution":{"observed_at":"2026-07-03T20:08:55.533025Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":290,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:6b9aa499c89b5ddc3b9cfc17ba63e7832470a343cb98d8768a550b86b997a69c","observation_id":"5f1e41ae-a87e-4c4d-89e3-d6cd7dc11e84","resolution":{"observed_at":"2026-07-04T06:39:37.446577Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2606.23557","last_updated":"2026-06-22T16:28:11Z","snapshot_observed_at":"2026-08-05T01:24:53.186762Z","submitted_at":"2026-06-22T16:28:11Z","title":"Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T08:38:46.044079Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2606.23557"},"observation_digest":"sha256:f4720c06744b3aa66a2ce3c57d98c265cd8290d8bddfa4126aeaacdd8e850b4a","observation_id":"13fe428f-8c6a-4bb8-a1c8-1a4f4c257cc0","resolution":{"observed_at":"2026-07-04T10:39:45.368680Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2606.23581","last_updated":"2026-06-22T16:47:00Z","snapshot_observed_at":"2026-07-06T23:58:16.163783Z","submitted_at":"2026-06-22T16:47:00Z","title":"Kamera: Unified Position-Invariant Multimodal KV Cache for Training-Free Reuse","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-26T07:13:19.593093Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2606.23581"},"observation_digest":"sha256:de455338d1485f9ec793674835742142f748cca9d8ee083bc4a1f72801dba8bb","observation_id":"9c355570-673b-4952-9a46-c4e119daec73","resolution":{"observed_at":"2026-07-04T12:09:48.873083Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2607.02089","last_updated":"2026-07-01T14:25:43Z","snapshot_observed_at":"2026-08-02T16:57:02.105465Z","submitted_at":"2026-07-01T14:25:43Z","title":"ESC: Emotional Self-Correction for Reliable Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-03T21:20:00.041277Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2607.02089"},"observation_digest":"sha256:541206e9f325ee816384aefe1cf1cfd7bb5fb72207cde466ac819d72d0973d37","observation_id":"d1a90f2f-7dbe-4c44-974c-2ec2accbd19b","resolution":{"observed_at":"2026-07-03T21:28:58.423966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-01T12:40:56.938008Z","title":"Haotian Liu, Chunyuan Li, Yuheng Li, and Yong Jae Lee","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26596","last_updated":"2026-07-29T08:16:28Z","snapshot_observed_at":"2026-08-07T19:27:23.125369Z","submitted_at":"2026-07-29T08:16:28Z","title":"Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T12:40:56.938008Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2607.26596"},"observation_digest":"sha256:dea1b7109eb50c4f6be3b5f45c53d1ecdacb27ab15504571bee802915877db12","observation_id":"5a61cdb0-9ed5-417f-95a6-a18341fcdc43","resolution":{"observed_at":"2026-08-01T12:40:56.938008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.07533/citation-record","integrity":"/paper/2312.07533/integrity","json":"/paper/2312.07533/citation-record.json","paper":"/paper/2312.07533"},"outbound":[],"paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 33 inbound Pith citation observations for arXiv:2312.07533."}