{"as_of":"2026-08-17T08:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4d82044623ba18bb6c14b5399d683e749e631ad4a18b79736364d6941da9474b","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:49:28.151834Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.08971/citation-record","integrity":"/paper/2505.08971/integrity","json":"/paper/2505.08971/citation-record.json","paper":"/paper/2505.08971"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-15T21:49:27.672537Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.672537Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:5fff01cb5520781b6fe1c8f8b4532fc2389c60853e75067aa0b2107ca6a2af69","observation_id":"b4a69d45-0675-4a6f-9889-01abd5f98526","resolution":{"observed_at":"2026-08-15T21:49:27.672537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-08-17T03:00:38.806206Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-15T21:49:27.678003Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.678003Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:6578f65b66d8e0a10c2259f1e3c785c18bc5e197a30cd1963190e39b31a0f555","observation_id":"eac79578-b33d-4d61-8055-54d5347c4c7a","resolution":{"observed_at":"2026-08-15T21:49:27.678003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.681895Z","title":"MINT-1T: scaling open-source multimodal data by 10x: A multimodal dataset with one trillion tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.681895Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:09dd53c5ba038651f9a40263b6ffc7c74d4703e1b834c44f47cb3a45a72f8209","observation_id":"2e4b0177-ebec-4c49-bb28-d1620663d0b2","resolution":{"observed_at":"2026-08-15T21:49:27.681895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T21:49:27.685443Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.685443Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:b434613e15d343831a30a3325cd357e27bc34a70b8645a407e141d5c6f004083","observation_id":"8b7b35db-ab7d-4346-bb4a-ec2459e40c71","resolution":{"observed_at":"2026-08-15T21:49:27.685443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.689864Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.689864Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:0c81895b5da873782dd9d7ad4b17233e7e48e16f11eb628a60a2e8e86272a5eb","observation_id":"bf650b6e-bd5b-42eb-8b00-a0ef908fd3d7","resolution":{"observed_at":"2026-08-15T21:49:27.689864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.694115Z","title":"Lundberg, Harsha Nori, Hamid Palangi, Marco T´ulio Ribeiro, and Yi Zhang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.694115Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:80dc1fc124c0db5be9646592bd72211abc8e0024ed1bcf1e552491022014163c","observation_id":"a1748332-e4c4-4340-ab26-ebe6c57d6913","resolution":{"observed_at":"2026-08-15T21:49:27.694115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-7","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.531952Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":"23e94cf5-5243-4caf-9f62-503b6a80a4cc","year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.702072Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:ef068aa83606ca4dcf1c4bfb82241894ca5dac72e0e8f61fc3063023727882c7","observation_id":"193d4a2f-c0a6-4676-bdd2-cc379ab3f6dc","resolution":{"observed_at":"2026-08-15T21:49:28.536110Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-15T21:49:27.706161Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.706161Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:515fc125b212c00fd97264c4c66ef03a0cb4600af332275947637790d15feeb2","observation_id":"e5337ba4-b7db-4866-a6ed-8045cbbe4d53","resolution":{"observed_at":"2026-08-15T21:49:27.706161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.710172Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.710172Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:fdae849620a7196173f0684d91f687a2ba9c1a9665b9560d127f9ba918bf651c","observation_id":"7d6176b4-2d18-4521-bfd1-43c0e6ddca68","resolution":{"observed_at":"2026-08-15T21:49:27.710172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05243","last_updated":"2024-12-06T18:22:47Z","snapshot_observed_at":"2026-08-11T20:47:10.764744Z","submitted_at":"2024-12-06T18:22:47Z","title":"CompCap: Improving Multimodal Large Language Models with Composite Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05243","snapshot_observed_at":"2026-08-15T21:49:27.714083Z","title":"Compcap: Improving multimodal large language models with composite captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.714083Z"},"links":{"cited_paper":"/paper/2412.05243","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:5c575aa54d58f6ae724830b09b31f1aad601d5b53a54a2a4a3cad8dada960fd8","observation_id":"b900c1c4-cf50-4c71-a589-a6197200a49f","resolution":{"observed_at":"2026-08-15T21:49:27.714083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10081","last_updated":"2024-03-19T17:51:45Z","snapshot_observed_at":"2026-08-16T14:42:35.827825Z","submitted_at":"2023-11-16T18:37:29Z","title":"DRESS: Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10081","snapshot_observed_at":"2026-08-15T21:49:27.722824Z","title":"Dress: Instructing large vision-language models to align and interact with humans via natural language feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.722824Z"},"links":{"cited_paper":"/paper/2311.10081","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:6fc8300438bf8d149a67eb0a4d5fc4044d4585c658bb3427188a37140a49c9d9","observation_id":"f3f217c6-9abe-4c43-ab6a-a8756bade8e0","resolution":{"observed_at":"2026-08-15T21:49:27.722824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13258","last_updated":"2023-11-22T09:23:34Z","snapshot_observed_at":"2026-08-16T14:41:14.213731Z","submitted_at":"2023-11-22T09:23:34Z","title":"ViStruct: Visual Structural Knowledge Extraction via Curriculum Guided Code-Vision Representation","version":1},"cited_work":{"arxiv_id":"2311.13258","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.13258","snapshot_observed_at":"2026-08-15T21:49:29.094905Z","title":"ViStruct: Visual Structural Knowledge Extraction via Curriculum Guided Code-Vision Representation","venue":"cs.CV","work_id":"a2ed5b6b-51e1-4953-859f-61c514867517","year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.726826Z"},"links":{"cited_paper":"/paper/2311.13258","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:9a8f406b2092a95e34ce047e011e2e5c11cebaf338bba88aba72b9eb88411545","observation_id":"ef02f1db-390f-4a24-b7e8-23c29d79ab26","resolution":{"observed_at":"2026-08-15T21:49:29.099720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08527","last_updated":"2025-04-07T21:47:09Z","snapshot_observed_at":"2026-08-16T13:10:27.890768Z","submitted_at":"2024-10-11T04:57:48Z","title":"Scaling Laws for Predicting Downstream Performance in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08527","snapshot_observed_at":"2026-08-15T21:49:27.730622Z","title":"Scaling laws for predicting downstream performance in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.730622Z"},"links":{"cited_paper":"/paper/2410.08527","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:db1dc5309bbf659a382bf50573aa2ce99bf38eea53304a614f06d5859cbba2e5","observation_id":"80f5c340-a661-4d8b-9aea-0324e68270d6","resolution":{"observed_at":"2026-08-15T21:49:27.730622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-16T13:35:58.335260Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-15T21:49:27.734866Z","title":"A single transformer for scalable vision- language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.734866Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:6726fd579c8693487623dc5a99420f28c255012bc8a8970b850dd907b152d5a6","observation_id":"f7a0b0cc-42e7-4957-8077-93ec3a6cb291","resolution":{"observed_at":"2026-08-15T21:49:27.734866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.739146Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.739146Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:5904b7d235060813fabc9aebfcf884a0d86632b4ae47d0a329bd0ef6b1460b18","observation_id":"79b26b88-b6ec-4573-8418-6c9a459c59cf","resolution":{"observed_at":"2026-08-15T21:49:27.739146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08687","last_updated":"2025-03-25T22:17:42Z","snapshot_observed_at":"2026-08-16T13:00:15.156174Z","submitted_at":"2024-12-11T18:59:46Z","title":"VisionArena: 230K Real World User-VLM Conversations with Preference Labels","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08687","snapshot_observed_at":"2026-08-15T21:49:27.743070Z","title":"Gonzalez, and Wei-Lin Chiang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.743070Z"},"links":{"cited_paper":"/paper/2412.08687","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:27135073a063816b269c584eacb283f69e9f8f5ab8f7feed4525fd960e13fe6a","observation_id":"5f997c8d-10f6-4d55-aa56-1ef07d717643","resolution":{"observed_at":"2026-08-15T21:49:27.743070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.747119Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.747119Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:cf2b2d52f61edf9623d4d4f3d57dc066d9d785ddd89eea3613d49f5bd43fe7a6","observation_id":"365ae205-0775-4f22-812c-fb6b119112ac","resolution":{"observed_at":"2026-08-15T21:49:27.747119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-08-16T13:17:44.282942Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-15T21:49:27.751226Z","title":"NVLM: open frontier-class multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.751226Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:8821091182ae333d6643ca1909a444ce150c12a16a26a79be3acdf17bc5c1876","observation_id":"eb3e2227-14db-4f52-a364-5876d877d964","resolution":{"observed_at":"2026-08-15T21:49:27.751226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.755310Z","title":"Unveiling encoder-free vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.755310Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:b65d4112f8c82faf705824c61ffa000376d38b465848838a2e18522725f01113","observation_id":"a44695a5-20f7-4c90-9b42-69e27ac5eb05","resolution":{"observed_at":"2026-08-15T21:49:27.755310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.759085Z","title":"A survey of vision-language pre-trained models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.759085Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:2712624b492e3ef9a52f8d2a6d580cfc6da2163a566da9698705c2ba548380db","observation_id":"82f4f70d-6151-44d4-a90c-b8a976f052a3","resolution":{"observed_at":"2026-08-15T21:49:27.759085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11691","last_updated":"2025-08-28T09:40:49Z","snapshot_observed_at":"2026-08-16T13:33:47.086873Z","submitted_at":"2024-07-16T13:06:15Z","title":"VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11691","snapshot_observed_at":"2026-08-15T21:49:27.762903Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.762903Z"},"links":{"cited_paper":"/paper/2407.11691","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:a8c4df876cca683825050d36858395de4fcef925d3443a7750a40b8c238630a6","observation_id":"2638719a-6663-4c36-8752-37b15a7b659b","resolution":{"observed_at":"2026-08-15T21:49:27.762903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T21:49:27.767272Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.767272Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:56133183651a1d0a6e678e950a5a0615666350d07e1e33d1e2c476374f5d432a","observation_id":"318baf8d-a093-4204-af64-0384b002044f","resolution":{"observed_at":"2026-08-15T21:49:27.767272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14506","last_updated":"2025-07-17T18:53:04Z","snapshot_observed_at":"2026-08-16T13:32:38.056236Z","submitted_at":"2024-07-19T17:58:36Z","title":"On Pre-training of Multimodal Language Models Customized for Chart Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14506","snapshot_observed_at":"2026-08-15T21:49:27.771127Z","title":"On pre-training of multimodal language models customized for chart understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.771127Z"},"links":{"cited_paper":"/paper/2407.14506","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:d53b83c333a4c2c11771a78b9832b1ed8ea619c05c71ba1d35f63c0b9e1570ed","observation_id":"17d48c46-1b18-46bd-8c29-9480716cab80","resolution":{"observed_at":"2026-08-15T21:49:27.771127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.779889Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.779889Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:a1192ccf14fffb9eb8c9f38783430baa7fec11d6f2f82e74d90e11609976a3a5","observation_id":"2b3c34e9-828b-4093-9126-33a9a2bd0920","resolution":{"observed_at":"2026-08-15T21:49:27.779889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14506","last_updated":"2025-07-17T18:53:04Z","snapshot_observed_at":"2026-08-16T13:32:38.056236Z","submitted_at":"2024-07-19T17:58:36Z","title":"On Pre-training of Multimodal Language Models Customized for Chart Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14506","snapshot_observed_at":"2026-08-15T21:49:27.775568Z","title":"URL https://doi.org/10.48550/arXiv.2407","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.775568Z"},"links":{"cited_paper":"/paper/2407.14506","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:6b04d72379189e2312cdc015776100cd07347557df87766093837ebbf712afdf","observation_id":"ce61c136-8d4b-4514-8c5e-204acd8d0cc5","resolution":{"observed_at":"2026-08-15T21:49:27.775568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.787389Z","title":"Making llama SEE and draw with SEED tokenizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.787389Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:2c17d22b1e0c54091379d33bcf36820b804656133828c5440d36ac8a085a723c","observation_id":"6d789315-dd49-4844-a28b-1c0980a06322","resolution":{"observed_at":"2026-08-15T21:49:27.787389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-08-12T23:40:42.885633Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-15T21:49:27.783967Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.783967Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:c16b6ff2c4d8869410f06d8dd1cb676acad73079c9e71386e3ecbc526e8ce8ae","observation_id":"261dcc71-7fd3-4ff6-a3db-4693e805c0ce","resolution":{"observed_at":"2026-08-15T21:49:27.783967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14907","last_updated":"2025-07-29T21:19:06Z","snapshot_observed_at":"2026-08-16T12:57:09.138408Z","submitted_at":"2025-02-19T00:14:29Z","title":"GneissWeb: Preparing High Quality Data for LLMs at Scale","version":2},"cited_work":{"arxiv_id":"2502.14907","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.14907","snapshot_observed_at":"2026-08-15T21:49:29.040411Z","title":"GneissWeb: Preparing High Quality Data for LLMs at Scale","venue":"cs.CL","work_id":"cddf30a7-395a-45d1-a272-0e464491eb9d","year":2025},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.799078Z"},"links":{"cited_paper":"/paper/2502.14907","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:9f0f996499e275af109bc25a92e9bfe6ec1874e6c2d4822f80cd73b6d434e186","observation_id":"3e8ba83b-2c37-4ea6-813b-205a423b23d6","resolution":{"observed_at":"2026-08-15T21:49:29.045263Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.791070Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.791070Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:d558894d624b221b1e9b621759ad1115a9e8d732301fa7337290830e9cc25279","observation_id":"2c1f37b1-9fae-4d97-b5b4-a15a1b0d5d06","resolution":{"observed_at":"2026-08-15T21:49:27.791070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.794662Z","title":"Exploring the frontier of vision-language models: A survey of current methodologies and future directions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.794662Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:1f75f606ad3e5802bc41fc05974aba40be5005dc699f1ccd6c19ab776388dad9","observation_id":"90741552-0327-4828-a6bd-6b6511beaa7a","resolution":{"observed_at":"2026-08-15T21:49:27.794662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12568","last_updated":"2024-09-19T08:41:21Z","snapshot_observed_at":"2026-08-16T13:17:15.224129Z","submitted_at":"2024-09-19T08:41:21Z","title":"InfiMM-WebMath-40B: Advancing Multimodal Pre-Training for Enhanced Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12568","snapshot_observed_at":"2026-08-15T21:49:27.810010Z","title":"Infimm-webmath-40b: Advancing multi- modal pre-training for enhanced mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.810010Z"},"links":{"cited_paper":"/paper/2409.12568","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:b4c992d3e64e1d28d44864a97ed77823d00c1c941475ef67b1a81517b327d193","observation_id":"02a9fbaa-accb-46e2-9ae0-697d8c48db7f","resolution":{"observed_at":"2026-08-15T21:49:27.810010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-08-16T15:34:45.261111Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-15T21:49:27.802928Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.802928Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:cca001f281c3503a5c22ac68b93627cc5944413cf0483f96e8c1a6edb589e892","observation_id":"f7140819-8ced-4d7d-b98a-4f199578fae2","resolution":{"observed_at":"2026-08-15T21:49:27.802928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-15T21:49:27.806428Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.806428Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:18bb7c9f7cb434d8a49998d58d05e986f71ff0735502a5ab72233f2399b5670c","observation_id":"e98f92c9-47e8-4a08-a328-0c1cdccc6de9","resolution":{"observed_at":"2026-08-15T21:49:27.806428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-15T21:49:27.822792Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.822792Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:276ad06dca27f8292db8cc805083b4320a5d0503e6c6380596beeb0a2d56d355","observation_id":"fd34ff79-fe5c-48bb-81c4-b443b111b954","resolution":{"observed_at":"2026-08-15T21:49:27.822792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09937","last_updated":"2024-08-19T13:55:42Z","snapshot_observed_at":"2026-08-16T14:00:45.702335Z","submitted_at":"2024-04-15T17:03:41Z","title":"Compression Represents Intelligence Linearly","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09937","snapshot_observed_at":"2026-08-15T21:49:27.814220Z","title":"Compression represents intelligence linearly","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.814220Z"},"links":{"cited_paper":"/paper/2404.09937","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:cef044c84bac19b31b99b476c824f7d06996db8971b95ae5726a9ecc43c5146e","observation_id":"b1cc2334-1a52-4202-9562-d6522531ad34","resolution":{"observed_at":"2026-08-15T21:49:27.814220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T21:49:27.818250Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.818250Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:b4f1f7a7f71779d2685207664c553e2f8a89e38f5494452ef93f635b276a2477","observation_id":"5f83a591-95c1-4821-8c14-0b91a272b4e2","resolution":{"observed_at":"2026-08-15T21:49:27.818250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10462","last_updated":"2025-04-14T17:50:20Z","snapshot_observed_at":"2026-08-16T12:41:13.769930Z","submitted_at":"2025-04-14T17:50:20Z","title":"The Scalability of Simplicity: Empirical Analysis of Vision-Language Learning with a Single Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10462","snapshot_observed_at":"2026-08-15T21:49:27.833950Z","title":"The scalability of simplicity: Empirical analysis of vision-language learning with a single transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.833950Z"},"links":{"cited_paper":"/paper/2504.10462","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:4296a70e08f790c44151f91058f465b0a08381f982d14acb834ba732007321fa","observation_id":"a3172c1e-ea2e-428d-96a7-4e2d469dff55","resolution":{"observed_at":"2026-08-15T21:49:27.833950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.826874Z","title":"Grounding language models to images for multimodal inputs and outputs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.826874Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:91dd9521f59c3b1e89d56e4ad2fc75a5a8684338e5c98d97575b5fc9aab5fe9d","observation_id":"15b72efd-41e5-4a00-861f-fecff345027b","resolution":{"observed_at":"2026-08-15T21:49:27.826874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11275","last_updated":"2022-10-21T10:24:00Z","snapshot_observed_at":"2026-08-16T21:04:16.474876Z","submitted_at":"2022-05-23T12:47:13Z","title":"RL with KL penalties is better viewed as Bayesian inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11275","snapshot_observed_at":"2026-08-15T21:49:27.830463Z","title":"Rl with kl penalties is better viewed as bayesian inference","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.830463Z"},"links":{"cited_paper":"/paper/2205.11275","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:bcfa856fd647fd6c9af913e29d3cc281fbd572f2663b9f30410ef0b319bec108","observation_id":"876999fe-af79-4977-ba31-ae9939d891db","resolution":{"observed_at":"2026-08-15T21:49:27.830463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.844873Z","title":"Datacomp-lm: In search of the next generation of training sets for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.844873Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:e137a9b59cbf28c8a5717872bd250f692393d6cc975bc90845d172a0e33a24f2","observation_id":"eb459e6f-d094-4a22-b529-c4d5196e416d","resolution":{"observed_at":"2026-08-15T21:49:27.844873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-15T21:49:27.838051Z","title":"Otter: A multi-modal model with in-context instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.838051Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:574059fda7bf4e1b10e337941bdcc3e7d67d63e08c39a922768eaeb4c76731fc","observation_id":"6f610eba-bf88-417c-9484-6b7154780b3f","resolution":{"observed_at":"2026-08-15T21:49:27.838051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.841739Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.841739Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:f550da77f672bda84d32c85e360ae90aa58e5ecdff15efd25706416d065a0185","observation_id":"c0160033-8a5e-4766-9c5b-caf5b1c93210","resolution":{"observed_at":"2026-08-15T21:49:27.841739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-08-16T14:34:02.863082Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-15T21:49:27.856076Z","title":"Silkie: Preference distillation for large visual language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.856076Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:93370f17137ff19b5ac5952a47fcc79d5c10e9ff744dbfb1d9d7aeac9db48d82","observation_id":"7480b147-b897-4d8e-9dd4-b9379c5240ac","resolution":{"observed_at":"2026-08-15T21:49:27.856076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.848093Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.848093Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:ca05b6ef1f367edc4c0fe230b63c510339218b0dca15e673bd154c4c21f4499c","observation_id":"4d435741-251e-484a-a5fa-5145de9af93e","resolution":{"observed_at":"2026-08-15T21:49:27.848093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.851400Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.851400Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:60bca6c29317c00a653f05b0a6197bef7cdd947df7200079d8abde38606307cb","observation_id":"83152920-85f9-464a-a8b2-9e820abe7f2d","resolution":{"observed_at":"2026-08-15T21:49:27.851400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08418","last_updated":"2024-07-12T08:54:51Z","snapshot_observed_at":"2026-08-16T13:43:39.205872Z","submitted_at":"2024-06-12T17:01:04Z","title":"OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08418","snapshot_observed_at":"2026-08-15T21:49:27.867920Z","title":"Omnicorpus: A unified multimodal corpus of 10 billion-level images interleaved with text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.867920Z"},"links":{"cited_paper":"/paper/2406.08418","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:89151d655897d79858ad8e8123b3f4c8e03154ded119ea2a39cc07fa796e179a","observation_id":"e389e1cd-a794-40d7-bfc2-84c10a3bb9d7","resolution":{"observed_at":"2026-08-15T21:49:27.867920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.860976Z","title":"Multimodal arxiv: A dataset for improving scientific comprehension of large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.860976Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:24a0b0c7cf851040901d5a54d97e162708f91111f2816e750049819e3515c3c5","observation_id":"64b974cf-03f0-4957-9ade-a54420a8ddf9","resolution":{"observed_at":"2026-08-15T21:49:27.860976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.864520Z","title":"Visualbert: A simple and performant baseline for vision and language","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.864520Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:24291e7411272eb543faf9ef6093998da433f9f88d2bea767fd21f69fda66b9d","observation_id":"0e1943bf-0a4e-4196-943c-f2405ecb5dc8","resolution":{"observed_at":"2026-08-15T21:49:27.864520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06511","last_updated":"2025-06-07T19:16:22Z","snapshot_observed_at":"2026-08-16T13:11:17.295056Z","submitted_at":"2024-10-09T03:26:11Z","title":"TorchTitan: One-stop PyTorch native solution for production ready LLM pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06511","snapshot_observed_at":"2026-08-15T21:49:27.879585Z","title":"Torchtitan: One-stop pytorch native solution for production ready LLM pre- training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.879585Z"},"links":{"cited_paper":"/paper/2410.06511","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:21cd654a1da8927e9e471cd1d49f237a2b3fecb06820bf9ec480e7eae31e8bab","observation_id":"030a7c39-0ea4-48c8-985e-e6137171ad2d","resolution":{"observed_at":"2026-08-15T21:49:27.879585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-15T21:49:27.871672Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.871672Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:85872dec0e111723a5e2c941dfa1e9c297d307d988e1fb926289607c2b705092","observation_id":"5f3ca946-0d59-4336-ab7c-e5c123507aef","resolution":{"observed_at":"2026-08-15T21:49:27.871672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-11T01:59:38.596539Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14818","snapshot_observed_at":"2026-08-15T21:49:27.875302Z","title":"´Alvarez, Bryan Catanzaro, Jan Kautz, Andrew Tao, Guilin Liu, and Zhiding Yu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.875302Z"},"links":{"cited_paper":"/paper/2501.14818","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:4a244b3f28ae7ec12be356d112dcfd9625ded4606af748084832ef736edeb09e","observation_id":"a24ff640-5790-44ae-81e3-8638138857b3","resolution":{"observed_at":"2026-08-15T21:49:27.875302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-15T23:41:03.981699Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-15T21:49:27.994447Z","title":"Aligning large multi-modal model with robust instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.994447Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:dc6ff67603bbc64a6788daa2dc9d11ef22271375a5814b6d50cc6286feffc209","observation_id":"d0b3e2b7-8bed-41e6-810d-ead96c0b64d5","resolution":{"observed_at":"2026-08-15T21:49:27.994447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13145","last_updated":"2025-03-18T07:02:33Z","snapshot_observed_at":"2026-08-16T12:57:12.589337Z","submitted_at":"2025-02-18T18:59:57Z","title":"Multimodal Mamba: Decoder-only Multimodal State Space Model via Quadratic to Linear Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13145","snapshot_observed_at":"2026-08-15T21:49:27.884393Z","title":"Multimodal mamba: Decoder-only multimodal state space model via quadratic to linear distillation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.884393Z"},"links":{"cited_paper":"/paper/2502.13145","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:ba756361916dbe9727c618a5376d873b9219bdf5788b6c5073ad3f5be6393b59","observation_id":"55e44184-c986-4471-9ab1-d201a7d5b174","resolution":{"observed_at":"2026-08-15T21:49:27.884393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:29.369257Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"99c53cbb-c0f7-48d4-af56-b542f9d7ed68","year":2014},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.888232Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:9bc596eaa94db4ca890295bfe842de07865facd08e5cade5426d50f499706304","observation_id":"64af87a0-4391-48d9-a7b1-402833b212ec","resolution":{"observed_at":"2026-08-15T21:49:29.373240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:29.356250Z","title":"Visual instruction tuning","venue":null,"work_id":"c4e66ba3-e72f-43bf-9243-71f3ba398ba4","year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.007067Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:89ff2bd89bd6f57d81d4047922cf4f0b266821ae74fd95c4947df6f87d7cc600","observation_id":"0f72c81f-683a-4b5a-8cb7-c7b016a21ec2","resolution":{"observed_at":"2026-08-15T21:49:29.360488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09731","last_updated":"2024-02-16T17:30:41Z","snapshot_observed_at":"2026-08-16T14:42:45.654301Z","submitted_at":"2023-11-16T10:02:40Z","title":"Examining LLMs' Uncertainty Expression Towards Questions Outside Parametric Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09731","snapshot_observed_at":"2026-08-15T21:49:27.999473Z","title":"Examining llms’ uncertainty expression towards questions outside parametric knowledge","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.999473Z"},"links":{"cited_paper":"/paper/2311.09731","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:ceb21050460bb00993124db70af337501bcfb42c2a8d1cef7e084443cd729283","observation_id":"c8d007ba-729f-4e2b-ba97-02809fd98630","resolution":{"observed_at":"2026-08-15T21:49:27.999473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-15T21:49:28.003360Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.003360Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:7a3e70a4af99bf3eb7b553233c87a5a8a4774c4b5baa13645d3ab55c20884dc6","observation_id":"74826612-12bf-4a03-a56c-c979fb637aa1","resolution":{"observed_at":"2026-08-15T21:49:28.003360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.018040Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.018040Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:cffd21ac4c241ad6bd066a13772f55e4323b1a629a458e79edc886b833cdc756","observation_id":"25e0a611-7da3-4a9a-a5f3-78cf6b062332","resolution":{"observed_at":"2026-08-15T21:49:28.018040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17451","last_updated":"2025-06-06T10:36:59Z","snapshot_observed_at":"2026-08-17T00:50:40.901836Z","submitted_at":"2024-12-23T10:18:41Z","title":"Diving into Self-Evolving Training for Multimodal Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17451","snapshot_observed_at":"2026-08-15T21:49:28.010620Z","title":"Diving into self- evolving training for multimodal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.010620Z"},"links":{"cited_paper":"/paper/2412.17451","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:8f77d3180b1eb7e509ef84add8a2df23f9f68be087622d53d79845ecec5ca541","observation_id":"1c4e6354-915d-4aab-ade1-b9e1fd6fde6e","resolution":{"observed_at":"2026-08-15T21:49:28.010620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15838","last_updated":"2024-08-07T09:34:25Z","snapshot_observed_at":"2026-08-16T13:32:03.059526Z","submitted_at":"2024-07-22T17:55:22Z","title":"MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15838","snapshot_observed_at":"2026-08-15T21:49:28.014362Z","title":"Mminstruct: A high-quality multi- modal instruction tuning dataset with extensive diversity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.014362Z"},"links":{"cited_paper":"/paper/2407.15838","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:679f5370e28909dbd28e166c82cbf7c1a830eff5891c6c23ac1ce42ebffba3d6","observation_id":"abcf93ad-1c9a-4057-a401-855473f41316","resolution":{"observed_at":"2026-08-15T21:49:28.014362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15232","last_updated":"2025-03-08T05:29:51Z","snapshot_observed_at":"2026-08-16T13:49:54.288029Z","submitted_at":"2024-05-24T05:46:04Z","title":"DEEM: Diffusion Models Serve as the Eyes of Large Language Models for Image Perception","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15232","snapshot_observed_at":"2026-08-15T21:49:28.035412Z","title":"DEEM: diffusion models serve as the eyes of large language models for image perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.035412Z"},"links":{"cited_paper":"/paper/2405.15232","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:65b743f2ee2ee98ab62829f413e6af68c5716c1c499d40878af646d3e9641043","observation_id":"ebb61c47-cd18-4434-9020-7256098dcdf9","resolution":{"observed_at":"2026-08-15T21:49:28.035412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-15T21:49:28.022589Z","title":"Deepseek-vl: Towards real-world vision-language understanding.CoRR, abs/2403.05525,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.022589Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:94401974be3a2729902d69af261ff7659b0a5b5e831f86b7a051f46696ac988d","observation_id":"fd2b56e1-36e0-4c13-ba33-2fda71e1fd25","resolution":{"observed_at":"2026-08-15T21:49:28.022589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-15T21:49:28.027700Z","title":"URL https://doi.org/10.48550/arXiv.2403","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.027700Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:2da8133a35afd5ec48da2ed78e6be8d336213f4657eeee1a91959587770d7a92","observation_id":"13a1a594-15ed-44fe-968a-0f57024e18d4","resolution":{"observed_at":"2026-08-15T21:49:28.027700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:29.335819Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":"4daa61fe-fdfc-4530-b8d4-3716498ce65c","year":2019},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.031470Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:4af100e31b608cb25ac58aa8178ba993531ea6c79b85fd58584e584f85618c37","observation_id":"96804bae-efba-4945-9a92-aa6c61c3e9ae","resolution":{"observed_at":"2026-08-15T21:49:29.339876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.051509Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.051509Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:469d1ba981b7d75e2804f72c53ff0ad14c3a35e58045a36724299494f04e121b","observation_id":"85f6e33c-f575-48ce-8f74-8ac8a5a68c97","resolution":{"observed_at":"2026-08-15T21:49:28.051509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05840","last_updated":"2024-12-31T14:46:47Z","snapshot_observed_at":"2026-08-16T13:20:01.876665Z","submitted_at":"2024-09-09T17:44:00Z","title":"MMEvol: Empowering Multimodal Large Language Models with Evol-Instruct","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05840","snapshot_observed_at":"2026-08-15T21:49:28.039274Z","title":"Mmevol: Empowering multimodal large language models with evol-instruct","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.039274Z"},"links":{"cited_paper":"/paper/2409.05840","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:1de94e32f5190c538438667af31a199d88a4566caf3e6b2b805a6cc53f029c52","observation_id":"d6cbddcc-b0f9-4c4f-87ed-ae55c6cbc287","resolution":{"observed_at":"2026-08-15T21:49:28.039274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.043623Z","title":"Openomni: Large language models pivot zero-shot omnimodal alignment across language with real-time self-aware emotional speech synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.043623Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:8b120742c44c31d316b782f27dee8dbe4d11205d3f9e0ecf9612328c4636e0ea","observation_id":"c1d25b96-0c5f-40ef-85d1-08513a34091f","resolution":{"observed_at":"2026-08-15T21:49:28.043623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.047320Z","title":"Policy opti- mization via importance sampling","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.047320Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:53fff07da077614be55c05bcdc9cf29c62a1d1d00482cb73fc2d684206fa2bfe","observation_id":"bb22e9f9-d6f7-4ba8-aab5-1e175efc7fce","resolution":{"observed_at":"2026-08-15T21:49:28.047320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.066102Z","title":"Laion- 5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.066102Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:67cef67daac01c0ddaff2c6f409c2efb7688f2d53db2966dae351527036b033f","observation_id":"1dbcd1a2-a988-47a4-a2d8-dd151e8fc9d5","resolution":{"observed_at":"2026-08-15T21:49:28.066102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.055287Z","title":"Shaker, Salman H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.055287Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:2e703dc897f7b4d4b3ab6198cbadef2ca08689d5c8c789d0042f3f720e7065fc","observation_id":"b9abe44e-0b76-4db6-ac12-ddaf0d0f5925","resolution":{"observed_at":"2026-08-15T21:49:28.055287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.058792Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.058792Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:0feead1104408155a90ea96bd7c87d1b611c619a2b1c195941a33cb9a404eeb7","observation_id":"3879d285-9344-4d6b-bf72-5688cc28d5f0","resolution":{"observed_at":"2026-08-15T21:49:28.058792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-15T21:49:28.062362Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.062362Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:8b2beee8a9078315507220b3821f1e16c3259746f3ef3957ea28d364f41268b8","observation_id":"d6bea31c-8c9a-4b51-8623-3ed4649d3763","resolution":{"observed_at":"2026-08-15T21:49:28.062362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:29.285937Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":"f1d8715e-3bc3-46ba-b08f-612dba6059ec","year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.080798Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:683edf9def4617d22affe72d7dd3236b8a41004c51b401e1c8643fd6469ad110","observation_id":"cb89ef5c-69ad-403c-aafe-b27ca3640b4e","resolution":{"observed_at":"2026-08-15T21:49:29.290113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:29.298596Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"f0a6eeb4-b959-49c6-9bf8-e18a8bbb7ecf","year":2018},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.069756Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:83a76752b4fe84b35b120efbfb562d76b8d689f89348d7665d231b8ec08f268b","observation_id":"5b5cbdee-8ca9-4930-91d5-bebdfe1845d3","resolution":{"observed_at":"2026-08-15T21:49:29.303589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-15T21:49:28.073076Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.073076Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:7e05e4cb302249aaeb527401c7689b06068271614550bb16bd2e9dbfd18359ac","observation_id":"360d5162-a319-46d7-8474-878065e5879a","resolution":{"observed_at":"2026-08-15T21:49:28.073076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16355","last_updated":"2023-05-25T04:16:07Z","snapshot_observed_at":"2026-08-14T10:09:12.476133Z","submitted_at":"2023-05-25T04:16:07Z","title":"PandaGPT: One Model To Instruction-Follow Them All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16355","snapshot_observed_at":"2026-08-15T21:49:28.077016Z","title":"Pandagpt: One model to instruction-follow them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.077016Z"},"links":{"cited_paper":"/paper/2305.16355","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:bf1e445c37d349aa4abaddf2a5cfc44522515d4bc731d1e604d9011fb482ec6c","observation_id":"3da53c17-8322-42eb-b5d4-d3185b89ee71","resolution":{"observed_at":"2026-08-15T21:49:28.077016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:29.272841Z","title":"OFA: unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","venue":null,"work_id":"7ebd7740-4567-49f8-b9b5-cfa3c06633e6","year":2022},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.095926Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:6bb67733bac17e3cc01bf778c2fd9092311e5b5c7a35ae85a4d6c7efd3172048","observation_id":"8ff4b12a-1022-4dd7-a36f-6792416b7a70","resolution":{"observed_at":"2026-08-15T21:49:29.277670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-08-15T23:42:34.277075Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-15T21:49:28.084067Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.084067Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:42ff8e3289db7bd8f8ebc0a6255526b608cf4a8f227cbbebbdae2d620be70368","observation_id":"2df2a628-0da3-4ae6-bef0-8615714bda71","resolution":{"observed_at":"2026-08-15T21:49:28.084067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-15T07:37:36.527948Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"cited_work":{"arxiv_id":"2412.16158","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.16158","snapshot_observed_at":"2026-08-15T21:49:28.694981Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","venue":"cs.CV","work_id":"4700f628-b9da-4e5b-88de-b527bde6656e","year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.087787Z"},"links":{"cited_paper":"/paper/2412.16158","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:a19c2636f322d5c0512dbec1dca878100b1bc55307b59e6a7bce278402abd945","observation_id":"84b0381f-ec30-40e2-8293-c9407eb28d2f","resolution":{"observed_at":"2026-08-15T21:49:28.700017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09575","last_updated":"2024-12-31T02:38:30Z","snapshot_observed_at":"2026-08-16T13:10:02.146064Z","submitted_at":"2024-10-12T15:54:29Z","title":"Reconstructive Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09575","snapshot_observed_at":"2026-08-15T21:49:28.091627Z","title":"Reconstructive visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.091627Z"},"links":{"cited_paper":"/paper/2410.09575","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:eed423462544065d5e761554fd378a2d7d60d49aaa81aa8ee134034d528edd21","observation_id":"3335f5c4-4051-491a-b313-b5ff7f2c1351","resolution":{"observed_at":"2026-08-15T21:49:28.091627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-15T21:49:28.110794Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.110794Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:bff9e62c5257bf6c2ea3b72086e155022793ed2def6dd0a80593ce43688b7130","observation_id":"ad5553e3-56c8-4a2e-89a1-af392a36dd7a","resolution":{"observed_at":"2026-08-15T21:49:28.110794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07617","last_updated":"2026-05-31T18:45:03Z","snapshot_observed_at":"2026-08-16T00:46:51.926803Z","submitted_at":"2025-02-11T15:05:33Z","title":"Scaling Pre-training to One Hundred Billion Data for Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07617","snapshot_observed_at":"2026-08-15T21:49:28.099780Z","title":"Scaling pre-training to one hundred billion data for vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.099780Z"},"links":{"cited_paper":"/paper/2502.07617","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:cbd6a4672449ad1f4d1d31adcd0930ad2019cb919dbea0a94f76d0eddaef53b7","observation_id":"1d93d7d5-4d49-4725-bcc1-7909cbddcb40","resolution":{"observed_at":"2026-08-15T21:49:28.099780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-16T18:01:13.363095Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-15T21:49:28.103319Z","title":"Simvlm: Sim- ple visual language model pretraining with weak supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.103319Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:935ffeb8fa9849529253d66f24d8ef5fb3362f2a700e21a96b7407d21c2e5155","observation_id":"d9749ed0-4144-48d1-ad61-70dc9e887f97","resolution":{"observed_at":"2026-08-15T21:49:28.103319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12067","last_updated":"2026-04-12T14:13:44Z","snapshot_observed_at":"2026-08-15T03:39:02.471554Z","submitted_at":"2023-08-23T11:27:30Z","title":"MM-LIMA: Less Is More for Alignment in Multi-Modal Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12067","snapshot_observed_at":"2026-08-15T21:49:28.107044Z","title":"Instructiongpt-4: A 200-instruction paradigm for fine-tuning minigpt-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.107044Z"},"links":{"cited_paper":"/paper/2308.12067","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:518bb72fa0efcc797ded52e1ea1f8625e473d39183396cc14fb36eaabdc39aae","observation_id":"0d837735-db69-4a1c-a801-adf9a07ce6de","resolution":{"observed_at":"2026-08-15T21:49:28.107044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:29.253205Z","title":"Knowledge-augmented few-shot visual relation detection","venue":null,"work_id":"4deee030-a775-43e9-9094-5906150559a3","year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.125115Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:f48e0c1aceaf9d738dbc27a5c998bf58ea68965b147fa579fe152207df3e5ce6","observation_id":"d5f5d2ea-f6fa-4feb-a59e-cef1e23e31cd","resolution":{"observed_at":"2026-08-15T21:49:29.257203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T21:49:28.114329Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.114329Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:62c9748a39ea990855f613ea53ef2f97cc408c77c71ef54e9d851b3526a65e83","observation_id":"eed933be-e5d8-4304-81af-4f50737727fe","resolution":{"observed_at":"2026-08-15T21:49:28.114329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14846","last_updated":"2025-05-21T14:42:25Z","snapshot_observed_at":"2026-08-16T12:56:33.725834Z","submitted_at":"2025-02-20T18:55:30Z","title":"Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14846","snapshot_observed_at":"2026-08-15T21:49:28.118433Z","title":"Scaling text-rich im- age understanding via code-guided synthetic multimodal data generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.118433Z"},"links":{"cited_paper":"/paper/2502.14846","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:46bf43b2a157ea37e6273278ec57b191c0e23472838286d4e241aae59306b2ff","observation_id":"290d4613-fbd5-4354-b505-ccf4a1af24e1","resolution":{"observed_at":"2026-08-15T21:49:28.118433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.121972Z","title":"Capsfusion: Rethinking image-text data at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.121972Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:634c013cd44528f037857f55396d03b10dd4c75d83337a90277c570897d643fe","observation_id":"f3c8e3e5-187a-4f61-b571-83731f8e9d7a","resolution":{"observed_at":"2026-08-15T21:49:28.121972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18411","last_updated":"2025-03-01T03:09:28Z","snapshot_observed_at":"2026-08-16T12:55:16.639239Z","submitted_at":"2025-02-25T18:05:14Z","title":"OmniAlign-V: Towards Enhanced Alignment of MLLMs with Human Preference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18411","snapshot_observed_at":"2026-08-15T21:49:28.140238Z","title":"Omnialign-v: Towards enhanced alignment of mllms with human preference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.140238Z"},"links":{"cited_paper":"/paper/2502.18411","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:04362d099c4fa4bab67d8a574a52324ee836147c6316f2be5b13f19d11b6443f","observation_id":"5713fdfb-d4ab-4fe3-8ad7-32ea69cf88df","resolution":{"observed_at":"2026-08-15T21:49:28.140238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:29.240891Z","title":"Xing, Xiaodan Liang, and Zhiqiang Shen","venue":null,"work_id":"010d6e39-e400-4b67-83ec-b95649fef898","year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.129074Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:e58c4ec1c1f0b90ac5e02d23f57b3c3242b4af8d84a839a600e5aef8acb6a285","observation_id":"048a03d7-ca78-4126-a150-c8fcb0b526ad","resolution":{"observed_at":"2026-08-15T21:49:29.244964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.132406Z","title":"Vinvl: Revisiting visual representations in vision-language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.132406Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:d590a67d5eec97cffa289c5ccb08b7b6f5146a8559794f62ecf35db865142ec5","observation_id":"3aea2af3-136b-4e7b-94b9-a7548592bc4a","resolution":{"observed_at":"2026-08-15T21:49:28.132406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10465","last_updated":"2025-04-14T17:52:22Z","snapshot_observed_at":"2026-08-16T12:41:13.823758Z","submitted_at":"2025-04-14T17:52:22Z","title":"Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10465","snapshot_observed_at":"2026-08-15T21:49:28.136196Z","title":"Pixel-sail: Single transformer for pixel-grounded understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.136196Z"},"links":{"cited_paper":"/paper/2504.10465","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:d4ac03296e3d89c3bbe6bb5c2b959b1983b1a7b50ab884bc2a664d0707c9805b","observation_id":"443d7519-58aa-4878-8b9a-b7cf2ec0812a","resolution":{"observed_at":"2026-08-15T21:49:28.136196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2310.02239","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.234311Z","title":"Minigpt-5: Interleaved vision-and-language generation via generative vokens","venue":null,"work_id":"9dfffd73-e8df-4671-91b4-d5db80138ebb","year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.144082Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:b01b05ca6f0306d9b35c7f0c72c57bfb1d7b594d67359c14dfd9f7d993e06414","observation_id":"e80c6efc-31ac-41fb-aad6-ac2ca9b4bde8","resolution":{"observed_at":"2026-08-15T21:49:28.240603Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:29.228745Z","title":"Minigpt-4: Enhanc- ing vision-language understanding with advanced large language models","venue":null,"work_id":"ca0dcc42-f204-498b-b25d-2683a5d5c7c1","year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.147999Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:0094ee143719c9171985885028a10adceb998d214a33cf820f53fadd2cf76453","observation_id":"0b3a4518-f49f-4699-99a1-4af729b51b37","resolution":{"observed_at":"2026-08-15T21:49:29.232823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.151834Z","title":"Generalized decoding for pixel, image, and language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.151834Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:cdcc4b8ece53118a2f801e44f011312f701cf7e5c098a2481b37c1fa8ee3e562","observation_id":"87d92ebd-c559-40de-af3c-bd1e0548a290","resolution":{"observed_at":"2026-08-15T21:49:28.151834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05243","last_updated":"2024-12-06T18:22:47Z","snapshot_observed_at":"2026-08-11T20:47:10.764744Z","submitted_at":"2024-12-06T18:22:47Z","title":"CompCap: Improving Multimodal Large Language Models with Composite Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05243","snapshot_observed_at":"2026-08-15T21:49:27.718480Z","title":"URL https://doi.org/10.48550/arXiv.2412","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.718480Z"},"links":{"cited_paper":"/paper/2412.05243","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:36fd3d90798bae861d2234faf4dd2d085c6742e95f0d8234fb142e22081cc67c","observation_id":"d08c95db-92d6-44b6-a2db-cdbd44d42d01","resolution":{"observed_at":"2026-08-15T21:49:27.718480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T23:29:15.711256Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":82,"verified_exact":5,"verified_fuzzy":9},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 0 inbound Pith citation observations for arXiv:2505.08971."}