Pith. sign in

Paper Citation Record · LEDGER

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models

As of 8 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2502.10250.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.10250 v2

Coverage vector

measured 14 of 14 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T18:51:10.479437Z

measured 14 of 14 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

14 of 14 outbound references displayed

  • verified exact1
  • verified fuzzy2
  • unresolved11
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation f54d4585-f05a-4c98-b478-db00235b1ff4 · outbound

This paper cites Mistral 7B.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models Mistral 7B

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.396754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.396754Z digest=sha256:56a4f260944ab9dfde27962dffd3e1c4a04aec42f63860fd8212041399925aa1

Observation 37a019c0-ccec-4600-a883-838bbd380c5f · outbound

This paper cites AnglE-optimized Text Embeddings.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models AnglE-optimized Text Embeddings

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.422113Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.422113Z digest=sha256:1cafea99987a3f4d63ac7a069c8cb7843a073ab95bd97c3282519d4a2e2cf16a

Observation cbe8465b-666e-4474-959d-90bd695456de · outbound

This paper cites Prismer: A Vision-Language Model with Multi-Task Experts.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models Prismer: A Vision-Language Model with Multi-Task Experts

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.428909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.428909Z digest=sha256:d0358631b09fbca378097b22ec791aae4164ce103c92768162da8f0e264f60d4

Observation b04e03f2-cdb9-478c-abd7-829f9ec0989f · outbound

This paper cites FuseCap: Leveraging Large Language Models for Enriched Fused Image Captions.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models FuseCap: Leveraging Large Language Models for Enriched Fused Image Captions

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-08-07T18:51:10.631920Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T18:51:10.437362Z digest=sha256:fc54f06becf7a849c855055c6bab3219feed0d1ac6743fea47c44f78343cf70e

Observation 5d72e60f-2d8a-4101-8f88-827bb158a8cc · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models Gemma: Open Models Based on Gemini Research and Technology

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.445511Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.445511Z digest=sha256:213bf4f21ab49b1840cf12e4428ab3b896dabbb45fa4d283b879126669bbf10a

Observation 4b7d06a7-4eb2-4aba-9c9f-11f48fbf400a · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.452158Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.452158Z digest=sha256:0daf6cd45687f2daf3c284b69717f0ee0a32249cfd2f7b16c7286bd55dccb6da

Observation b49e3b7c-8e44-478c-97c4-d55bc2c8562b · outbound

This paper cites OpenChat: Advancing Open-source Language Models with Mixed-Quality Data.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models OpenChat: Advancing Open-source Language Models with Mixed-Quality Data

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.458835Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.458835Z digest=sha256:52ef188636c02d44d2e5b6acdbd17e8fd10140fcc9ae1ac59d0675a377fbbb96

Observation 7d3b72f3-9ac3-47dc-971f-7913d16d98b5 · outbound

This paper cites Meta-Transformer: A Unified Framework for Multimodal Learning.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models Meta-Transformer: A Unified Framework for Multimodal Learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.466981Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.466981Z digest=sha256:830900bdad17b76b86756e0eeea2775b374194aafd243c210aeafc2891edb7d2

Observation 2b7debf4-1f14-4b51-964a-345353c0c1a1 · outbound

This paper cites MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.473670Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.473670Z digest=sha256:322c6b65d8b54f732151119660f636303d2100c8a8def2a6f37c2cd1461b2371

Observation 4c7a2227-17d8-4acd-839b-273b0c428175 · outbound

This paper cites (a) Distribution of Number of Tokens in the Source Context.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models (a) Distribution of Number of Tokens in the Source Context

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T18:51:10.771807Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T18:51:10.479437Z digest=sha256:8eb2cacc06bdc04d5faa3eb79622a847d26ceeffe51272cf4682fe4087d9f66c

Observation f007f6f7-fc3f-4d62-8d85-6c88dc5bb315 · outbound

This paper cites What matters when building vision-language models?.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models What matters when building vision-language models?

Reference 2016

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.414354Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.414354Z digest=sha256:8ef175c270218a1a1ed1ead91e89de16445693c2b915a27ae46bb9ce900ecc3b

Observation f21da683-72c6-467f-b430-15aeeb20059e · outbound

This paper cites ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.381594Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.381594Z digest=sha256:38df4ad9b863c2e57d590e0a554f1abf06412e92ab95a8a5e406c70d7a6be3ca

Observation a1df0bbb-20d8-44a9-8860-606321539e65 · outbound

This paper cites A diagram is worth a dozen images.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models A diagram is worth a dozen images

Reference 2023

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T18:51:10.791389Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T18:51:10.404020Z digest=sha256:b4bb9e910be823441ca53ce47f456d549f0ab8d9eb645b423097b89d62002fb9

Observation 087f2118-5123-4cfa-a18c-9d377f22aa4b · outbound

This paper cites ShareGPT4V: Improving Large Multi-Modal Models with Better Captions.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models ShareGPT4V: Improving Large Multi-Modal Models with Better Captions

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.388827Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.388827Z digest=sha256:39ec73e7c5f342e74d893d890bf183a6a6ac5f998da3c703b4b59262b885ae60

Pith citing papers

No inbound Pith citation observations are available.