{"as_of":"2026-08-09T15:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e467cdd09e476da6b17e290fb129f5a72a9229b5ee0755ed8591a5a333528b09","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:52:09.476244Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T04:35:49.701061Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"cited_work":{"arxiv_id":"2505.17316","doi":"10.48550/arxiv.2505.17316","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17316","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Analyzing","venue":"arXiv (Cornell University)","work_id":"ab03f708-44f5-403a-afb0-a7b9cfad03e0","year":2025},"citing_paper":{"arxiv_id":"2604.21343","last_updated":"2026-08-04T21:50:05Z","snapshot_observed_at":"2026-08-08T23:09:28.589207Z","submitted_at":"2026-04-23T06:58:08Z","title":"Latent Denoising Improves Visual Alignment in Large Multimodal Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-09T23:07:54.806529Z"},"links":{"cited_paper":"/paper/2505.17316","citing_paper":"/paper/2604.21343"},"observation_digest":"sha256:d9515d8ed7b45b4eb81cc28d79752edb923d12643fe0c3ffb04f95a927b5829c","observation_id":"016138de-0e18-46f9-a76b-1f2029ae70c9","resolution":{"observed_at":"2026-05-09T23:09:26.689929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:08.460289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:08.460289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"cited_work":{"arxiv_id":"2505.17316","doi":"10.48550/arxiv.2505.17316","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17316","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Analyzing","venue":"arXiv (Cornell University)","work_id":"ab03f708-44f5-403a-afb0-a7b9cfad03e0","year":2025},"citing_paper":{"arxiv_id":"2605.17187","last_updated":"2026-05-16T22:52:11Z","snapshot_observed_at":"2026-07-06T23:28:12.114488Z","submitted_at":"2026-05-16T22:52:11Z","title":"PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-20T14:05:14.737146Z"},"links":{"cited_paper":"/paper/2505.17316","citing_paper":"/paper/2605.17187"},"observation_digest":"sha256:26192978943d223709f12bf414f1e020328a958358d0cf626d39618ae8aa1d1f","observation_id":"9c925f13-3f9d-4834-b9d5-bd95ebda16bf","resolution":{"observed_at":"2026-05-20T14:08:20.436198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:08.460289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:08.460289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17316","snapshot_observed_at":"2026-07-12T04:35:49.701061Z","title":"arXiv preprint arXiv:2505.17316 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03143","last_updated":"2026-07-03T09:32:01Z","snapshot_observed_at":"2026-08-06T13:28:44.113197Z","submitted_at":"2026-07-03T09:32:01Z","title":"Text as Partial Constraint: Core-Residual Alignment for Robust Vision-Language Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-12T04:35:49.701061Z"},"links":{"cited_paper":"/paper/2505.17316","citing_paper":"/paper/2607.03143"},"observation_digest":"sha256:c505415e5fe0a2364d654da29e9152c9f0c05dfaa82d70b8cb63b60fbfb9c084","observation_id":"5774306e-2e1f-44d5-b230-98bb897ca4f1","resolution":{"observed_at":"2026-07-12T04:35:49.701061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.17316/citation-record","integrity":"/paper/2505.17316/integrity","json":"/paper/2505.17316/citation-record.json","paper":"/paper/2505.17316"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:14.354120Z","title":"Visual instruction tuning,","venue":null,"work_id":"d8769989-5111-4001-a64b-58ec321f3036","year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:04.097733Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:c32da8faca6c381ab109c39e6383234235bfc12f1cc22b15bd95cb3c34e2f5b9","observation_id":"fadc0ca7-aeda-4650-b84f-c888ac9a3105","resolution":{"observed_at":"2026-08-07T14:52:14.433783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:14.243308Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":"f33458ad-dfd4-4f4f-b254-b8668461279d","year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:04.208405Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:72931dc5495911cab48adf7d7b03b264a2447b3991134f98c59ab39bfacccaa4","observation_id":"29de9b4f-7a6c-45b0-ba66-65863a79d134","resolution":{"observed_at":"2026-08-07T14:52:14.277054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:04.379623Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:04.379623Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:6f814bd7260fca44347f2d577afe87dbd163986abd078f795eb7b93a09dc37b4","observation_id":"208045f1-7904-41c4-a316-77bcd68edc2c","resolution":{"observed_at":"2026-08-07T14:52:04.379623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:04.539750Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:04.539750Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:e80503c92e04d35e0e0ea51e1746cd2fcc93b88b66805b7cc6a2a6ef6a6e1eb0","observation_id":"70584995-12c7-48a0-89ce-68f725df6f8d","resolution":{"observed_at":"2026-08-07T14:52:04.539750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T14:52:04.677406Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:04.677406Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:1c3ff31bbfa7435f1f723c20f69c2cf88504dfee4d7f4c69a8b8dc5a30c28198","observation_id":"5db061ba-bb92-4291-80e2-ec1c3ab061f2","resolution":{"observed_at":"2026-08-07T14:52:04.677406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:04.770528Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:04.770528Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:2b1d6cf69ecd43a3d481feed16cd21b3db6cc20c8a84d407b2d4778f7bb513df","observation_id":"98609cdd-071d-48fc-a888-967810b5d0dd","resolution":{"observed_at":"2026-08-07T14:52:04.770528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:14.067492Z","title":"Language is not all you need: Aligning perception with language models,","venue":null,"work_id":"2cb29810-019d-4bf1-9f0b-2abd09c0f6b4","year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:04.917798Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:c5e0ddae72f667004e9cf11b2e4e563d967aaca7a458e32183fd59c876fd3c27","observation_id":"bc4869a1-3879-4476-9c1f-272048cb17a6","resolution":{"observed_at":"2026-08-07T14:52:14.117267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T14:52:05.094450Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:05.094450Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:8425fd6fb1bed54c9f638fa956192cb6bb8e9c0ef6027b632e0c55fc0f8d9b1c","observation_id":"47117c81-1b56-4a5b-aae9-9bfb30599547","resolution":{"observed_at":"2026-08-07T14:52:05.094450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:13.902303Z","title":"Kimi k1.5: Scaling reinforcement learning with llms,","venue":null,"work_id":"05af62b5-b0a5-4ba6-855d-a06e7e339f33","year":2025},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:05.186005Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:b6805cecddf8d90b7cafda0c4eeaba0cfd4a9ae8e05dfbb9f80686e0697bab21","observation_id":"09fdddc4-ddbc-4e47-8c00-b13a5032e0aa","resolution":{"observed_at":"2026-08-07T14:52:13.964943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:13.758602Z","title":"Multimodal transformer with multi-view visual representation for image captioning,","venue":null,"work_id":"e81e84f0-8853-481c-b474-663049108abd","year":2019},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:05.270372Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:ef7e51923715cbe687193b878d71115fdc9c87062909379938dbe023c91e67a7","observation_id":"61a44add-9445-4537-aaa6-470852bb6cc7","resolution":{"observed_at":"2026-08-07T14:52:13.839155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:05.384694Z","title":"Vqa: Visual question answering,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:05.384694Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:b020e62716d7858ffbbacdc49fdadfdc0f5094fdaf9d8fa340c6a0c9f3903a7a","observation_id":"12569a1d-b954-4dba-951a-aa8085cbd105","resolution":{"observed_at":"2026-08-07T14:52:05.384694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:05.476390Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:05.476390Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:983cfbeee6b4bfa79bba0ad9e2f2ca9b42229fac5ea9182f15ac56e66b968a2e","observation_id":"8bb64434-aec4-491f-8c0d-89bf212f3a5b","resolution":{"observed_at":"2026-08-07T14:52:05.476390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03601","last_updated":"2025-06-12T00:15:18Z","snapshot_observed_at":"2026-08-07T18:00:59.339869Z","submitted_at":"2023-07-07T13:43:44Z","title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03601","snapshot_observed_at":"2026-08-07T14:52:05.597599Z","title":"Gpt4roi: Instruction tuning large language model on region-of-interest,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:05.597599Z"},"links":{"cited_paper":"/paper/2307.03601","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:93f4c609f11bdade88e906b0f1914af334bd9566faa695cf64eb6097dffe441d","observation_id":"cc12dd15-7ac6-46de-a797-54b4ce1bddf1","resolution":{"observed_at":"2026-08-07T14:52:05.597599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-07T14:52:05.690123Z","title":"Kosmos-2: Grounding multimodal large language models to the world,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:05.690123Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:a8f45060be88392f1d84a62da2d99e399050c22ad5cfb3bf26f29924e9562886","observation_id":"53446d3c-8f1f-4f37-b759-51d558bf7049","resolution":{"observed_at":"2026-08-07T14:52:05.690123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:13.579479Z","title":"Glamm: Pixel grounding large multimodal model,","venue":null,"work_id":"b095c8c1-ddeb-4833-a678-e44cfdcea8b2","year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:05.769581Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:2071a02701256caf693525d66f357b859bb7b6b40061cc48190c7a27a28da64c","observation_id":"29156912-f77a-44c8-ac02-3ef445607f04","resolution":{"observed_at":"2026-08-07T14:52:13.659627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-07T14:52:05.858115Z","title":"Hallucination of multimodal large language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:05.858115Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:b199928c84c0b707d8050a2563de1b5028b2b9522fc22ad9eb80b366ee1b82a7","observation_id":"099610fd-b9dd-44de-855d-e0271fb59288","resolution":{"observed_at":"2026-08-07T14:52:05.858115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:13.414430Z","title":"Honeybee: Locality-enhanced projector for multi- modal llm,","venue":null,"work_id":"3ec49ecd-4654-4720-a06e-d7482d736f9b","year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.013664Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:b4834ae7e28c35408ae6576ee6fa1a2459b142e966efeb4f234e3ee6a3b7d94b","observation_id":"d751b048-6e58-4c5e-9b9d-f1acb8e9589a","resolution":{"observed_at":"2026-08-07T14:52:13.495833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07987","last_updated":"2024-07-25T09:33:50Z","snapshot_observed_at":"2026-08-06T11:02:06.607024Z","submitted_at":"2024-05-13T17:58:30Z","title":"The Platonic Representation Hypothesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07987","snapshot_observed_at":"2026-08-07T14:52:06.128909Z","title":"The platonic representation hypothesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.128909Z"},"links":{"cited_paper":"/paper/2405.07987","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:2806ed597cc6fac57d94bcd1babc574b3ac335177da24299c2b2d0221c45437d","observation_id":"3bcaf127-cac2-4f33-aa77-d8a119ec9186","resolution":{"observed_at":"2026-08-07T14:52:06.128909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:13.254793Z","title":"von Neumann,Mathematische Grundlagen der Quantenmechanik","venue":null,"work_id":"402f9222-4088-4c79-87f8-ffa217f4d22f","year":null},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.209608Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:758e74d2dd8fc331f65aa34a45dc60dd1fca35831ac88516795432838d0b9ea8","observation_id":"29f11f75-9d76-409a-8d86-51f6192b84f6","resolution":{"observed_at":"2026-08-07T14:52:13.345684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:12.952624Z","title":"Linear algebraic structure of word senses, with applications to polysemy,","venue":null,"work_id":"b69d8f4d-aa32-49ef-839a-711c8f2b990a","year":2018},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.426208Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:49f7637f720c8a6bdc720c38af2df9fb8489bb09a2d5f5531140961188595456","observation_id":"1cd1b476-c3c0-49af-a2cf-202ca427a365","resolution":{"observed_at":"2026-08-07T14:52:13.022576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15949","last_updated":"2023-04-04T06:43:19Z","snapshot_observed_at":"2026-07-06T10:54:39.400060Z","submitted_at":"2021-03-29T20:51:33Z","title":"Transformer visualization via dictionary learning: contextualized embedding as a linear superposition of transformer factors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15949","snapshot_observed_at":"2026-08-07T14:52:06.502588Z","title":"Transformer visualization via dictionary learning: contextualized embedding as a linear superposition of transformer factors,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.502588Z"},"links":{"cited_paper":"/paper/2103.15949","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:0cbbedf54439d1bfdd11473bdc69748a6d828dad89337ea6a48f24c1e8fd1f1d","observation_id":"ced2b0b2-19d7-456f-875c-eeb48feff724","resolution":{"observed_at":"2026-08-07T14:52:06.502588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:12.796586Z","title":"Signal recovery from random measurements via orthogonal matching pursuit,","venue":null,"work_id":"13a94d90-4b86-4f01-9710-e82ed11f0356","year":2007},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.619408Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:818549e5207581652eae08b8c15bdb43415d8c272cc52fb937406499240cf02c","observation_id":"ba7c44c2-883e-48e9-96ee-9444c5df2e11","resolution":{"observed_at":"2026-08-07T14:52:12.858259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:12.604309Z","title":"Recognize anything: A strong image tagging model,","venue":null,"work_id":"97e4d2d5-8eb0-4a8f-8e2e-d16b3c7198fd","year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.690111Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:b07264712da3d28d4eb4ebd162ba374ea44657195bc762715c644af7bcee8edb","observation_id":"bc3cf9d0-2f91-4990-82cc-56bd5650f420","resolution":{"observed_at":"2026-08-07T14:52:12.717265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:12.414347Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection,","venue":null,"work_id":"0e5651f3-12de-4953-9ede-f5135ada925a","year":2025},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.753385Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:8caba9678e05d09820417430bb9648693e3f9425f40e49300a3c596ef1d98723","observation_id":"8fedc27c-4a1b-4068-8304-468498f53fef","resolution":{"observed_at":"2026-08-07T14:52:12.505247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:06.817193Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.817193Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:0558b637475086da71caaf472212512bb534565078bf593dceba8c0a2be89329","observation_id":"69cb3100-d9ea-4117-95a9-8016afa821b8","resolution":{"observed_at":"2026-08-07T14:52:06.817193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T14:52:06.857116Z","title":"Llava-next-interleave: Tack- ling multi-image, video, and 3d in large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.857116Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:3cf883a59002ae286060dd6aa4412670e0c0a1d4d55cdbeeadeb3ea15fc8c4ac","observation_id":"f5cf6810-da43-4cd8-81d0-acd914e552a2","resolution":{"observed_at":"2026-08-07T14:52:06.857116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-07T14:52:06.924738Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning. arxiv 2023,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.924738Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:69d383feba57d6f2ef173c47b23948d23083f76648830ce3f3388a9df4e401c9","observation_id":"26a3b850-f28d-414e-a021-fcf65bd986ea","resolution":{"observed_at":"2026-08-07T14:52:06.924738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-07T14:52:06.984546Z","title":"Mimic-it: Multi-modal in-context instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.984546Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:30c90649f91ca14ce36496feaeed964b156d60574cc76aa9d884251534a74373","observation_id":"a61da63f-e94a-4644-8fe6-02badd35fdaa","resolution":{"observed_at":"2026-08-07T14:52:06.984546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-07T14:52:07.035989Z","title":"mplug- owl: Modularization empowers large language models with multimodality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.035989Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:ec40aa79aea37dfc2d2818e8fecc44e6c534b0b5482799b8270118092c2e7e38","observation_id":"a07487ff-fff9-47ec-8cc0-69e5657edb1b","resolution":{"observed_at":"2026-08-07T14:52:07.035989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07865","last_updated":"2024-05-30T13:08:48Z","snapshot_observed_at":"2026-08-05T12:05:09.343843Z","submitted_at":"2024-02-12T18:21:14Z","title":"Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07865","snapshot_observed_at":"2026-08-07T14:52:07.161010Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.161010Z"},"links":{"cited_paper":"/paper/2402.07865","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:d2f417850b14a3762740e812e888b7d22d348666d95f7b539ca5c73c744be8f6","observation_id":"294bd963-4843-4895-a63b-ea8567de710b","resolution":{"observed_at":"2026-08-07T14:52:07.161010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-07T14:52:07.253612Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.253612Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:ce53a4b6d06127283167d397113454aa23bc356a16b7f984be87a0b3ab6aface","observation_id":"410e58b5-1c87-450d-9d58-7086b04f6ba4","resolution":{"observed_at":"2026-08-07T14:52:07.253612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2408.16357","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:09.788755Z","title":"Law of vision representation in mllms,","venue":null,"work_id":"5c5bbc01-718c-49b0-9345-0c43812621bd","year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.363562Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:76151b521d14c06743865f937070f8499c951288aefce6895fb659757f46ecef","observation_id":"f78e1c9d-00dd-436e-bc06-0b9b921d9ed9","resolution":{"observed_at":"2026-08-07T14:52:09.875483Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:12.264580Z","title":"Learning transferable visual models from natural language supervi- sion,","venue":null,"work_id":"8e915332-5b53-485b-afd3-15c042677080","year":2021},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.459692Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:146b0b0f3512c6469aa640c7e900805622dacfe19fa1eeaf6bc00cce06feb975","observation_id":"58d0ae74-b066-4fa9-8c35-3430164cc0ef","resolution":{"observed_at":"2026-08-07T14:52:12.324474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","snapshot_observed_at":"2026-08-08T11:14:33.223909Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07167","snapshot_observed_at":"2026-08-07T14:52:07.553797Z","title":"Deciphering cross-modal alignment in large vision-language models with modality integration rate,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.553797Z"},"links":{"cited_paper":"/paper/2410.07167","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:89feb395036c119f39725ade89fd2673c92c7bc0dd339adfc2a1f397c0e3f523","observation_id":"afd9b67a-ee7f-4db6-a5d8-cecc6819e3b2","resolution":{"observed_at":"2026-08-07T14:52:07.553797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-03T16:26:26.684826Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-07T14:52:07.702315Z","title":"Towards interpreting visual information processing in vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.702315Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:3b682fbea19ddf64a3d223c4b6aa0e183ff33a51c2a85613c49b222cc774c005","observation_id":"d5c0e1f4-08fa-4fae-a4d5-f324eebe1557","resolution":{"observed_at":"2026-08-07T14:52:07.702315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09691","last_updated":"2024-11-14T18:57:07Z","snapshot_observed_at":"2026-08-05T04:29:40.575401Z","submitted_at":"2024-11-14T18:57:07Z","title":"Advancing Fine-Grained Visual Understanding with Multi-Scale Alignment in Multi-Modal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09691","snapshot_observed_at":"2026-08-07T14:52:07.801312Z","title":"Advancing fine-grained visual understanding with multi-scale alignment in multi-modal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.801312Z"},"links":{"cited_paper":"/paper/2411.09691","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:9950ca509eec333da2e8b4dd2ace912b63197891570b21dfb0c1189672d608ab","observation_id":"258e03ae-c032-4490-886e-02438a42f2c5","resolution":{"observed_at":"2026-08-07T14:52:07.801312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11813","last_updated":"2025-09-05T07:15:34Z","snapshot_observed_at":"2026-08-02T19:18:43.494855Z","submitted_at":"2024-08-21T17:58:02Z","title":"SEA: Supervised Embedding Alignment for Token-Level Visual-Textual Integration in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11813","snapshot_observed_at":"2026-08-07T14:52:07.914884Z","title":"Sea: Supervised embedding alignment for token-level visual-textual integration in mllms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.914884Z"},"links":{"cited_paper":"/paper/2408.11813","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:aafdebe22d4432b95e220baf886e8bfa99cd385c446757af1e30a810332d974a","observation_id":"15f7dcb8-de70-4ef8-a31d-a938af74c5c5","resolution":{"observed_at":"2026-08-07T14:52:07.914884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:12.124738Z","title":"Honeybee: Locality-enhanced projector for multimodal llm,","venue":null,"work_id":"bbd710c4-8d04-48c7-8e2d-4041e560e741","year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:08.003998Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:852a39c2d98211c8c935bc206df73f6d09faa5d6ba2d9652c594f78a2c163642","observation_id":"ffb7bfab-4a76-425f-9254-89705a2460c8","resolution":{"observed_at":"2026-08-07T14:52:12.176356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:08.137009Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:08.137009Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:d8772f3944e1000075ab73b6cb104c2df24a44948422c81e4dff893a2d95c84f","observation_id":"a4e8b62b-1cb5-45b0-aee7-596158711fb4","resolution":{"observed_at":"2026-08-07T14:52:08.137009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:11.906471Z","title":"Referitgame: Referring to objects in photographs of natural scenes,","venue":null,"work_id":"97175ee9-b64c-4a83-a369-254438ce4ba5","year":2014},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:08.278205Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:c6a32a201ce3e395366d42d9c7837c209bb4559e73fb637faaea7402cfc80521","observation_id":"66925e60-7f15-4ea4-b05c-42d93478d3d6","resolution":{"observed_at":"2026-08-07T14:52:11.991080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:11.703927Z","title":"Generation and comprehension of unambiguous object descriptions,","venue":null,"work_id":"b62d5ee2-765f-4f49-8704-55d91f579d3c","year":2016},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:08.425913Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:a8c03d4ab11921c938ed2bed83d8ed3951a67b414c22e4019ab84e783e7e3373","observation_id":"766fa7c7-55c0-4cef-81ca-9e6e07e5deed","resolution":{"observed_at":"2026-08-07T14:52:11.792342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-07T14:52:08.552384Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:08.552384Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:7b2b7a74c6b05d7a330564a79b6285027f96baa840c6de8931c31d8d3be4f45a","observation_id":"519e912a-9cd7-48be-99a7-28ddc9d0707c","resolution":{"observed_at":"2026-08-07T14:52:08.552384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:11.426261Z","title":"Introducing idefics: An open reproduction of state-of-the-art visual language model,","venue":null,"work_id":"a808e0c2-0209-4051-8183-1325e676bdfa","year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:08.630284Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:9dace4b3b8db1dc68f6fe211c33783664a5166e81ffaba9fe994a48e8362356c","observation_id":"94b6ad84-73b1-435c-aefb-38348b595dfe","resolution":{"observed_at":"2026-08-07T14:52:11.567486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T14:52:08.711601Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:08.711601Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:e7d46bc4b044e418fe1a28aa62c7ef178e0a7cab51d37f203abd00b2a907fc41","observation_id":"aebb9424-4cd8-4cc6-9db1-d85de7550613","resolution":{"observed_at":"2026-08-07T14:52:08.711601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-07T14:52:08.800402Z","title":"Instruction tuning with gpt-4,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:08.800402Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:7bc88588d9f632275905590ddc36d273b7aa8f1fa19e6e1cc3969ef6979500a0","observation_id":"3ee107fa-bfd8-4446-bb2a-7f31b967b7e0","resolution":{"observed_at":"2026-08-07T14:52:08.800402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:52:08.905998Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:08.905998Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:ecc1789d9717eee32cad315441825315bc4d30bca84e938184c610c873d48f45","observation_id":"da6a0ac9-3e8b-4782-b358-5e15b6c0d4cf","resolution":{"observed_at":"2026-08-07T14:52:08.905998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:11.177375Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":"376c5298-53a9-4f70-b073-839f005f173a","year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:09.039392Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:2d6a3105135a5193197cdb9907563ec656aed9e86292b4bbd6672f7f5adcfdad","observation_id":"55246c22-573a-4a8c-a38f-94e1528d6620","resolution":{"observed_at":"2026-08-07T14:52:11.305627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:10.934882Z","title":"Towards vqa models that can read,","venue":null,"work_id":"35b65749-409f-4c3f-a8b2-889a194a9a16","year":2019},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:09.193236Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:d9c2890fe11f87a33f8f6090e552af7bbaf1a3057107b05253c377de83874130","observation_id":"717aab0c-5678-414b-b5a8-09c0685b4fdd","resolution":{"observed_at":"2026-08-07T14:52:11.043224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:10.697469Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering,","venue":null,"work_id":"ee40da22-49c9-46b0-be18-62888090fff8","year":2019},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:09.291633Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:36b21699888617420a292a0e1aca59adda6e25ee96465d6b6b003f500504b712","observation_id":"b5e92fd3-23ec-473a-ba67-f160ea063043","resolution":{"observed_at":"2026-08-07T14:52:10.787542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:10.441381Z","title":"Ocr-vqa: Visual question answering by reading text in images,","venue":null,"work_id":"5e87f358-a64a-4fc6-8954-1775eab68e21","year":2019},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:09.394927Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:41819fe0d28f5c557e5058892140f5a4082e0182bc5a769ed313329c2ce03dc7","observation_id":"9143f5af-b801-45d4-b5fa-ced2989a23a3","resolution":{"observed_at":"2026-08-07T14:52:10.559675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:10.199829Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations,","venue":null,"work_id":"56453923-ca62-4d81-8369-b39a9a27eb92","year":2017},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:09.476244Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:da64ec41af00d48f19ab6c1c48f8d85eb98a704e0e984346cc55d7c404ca1593","observation_id":"894462a2-6627-4fe4-a7f7-ad0abbf5ec84","resolution":{"observed_at":"2026-08-07T14:52:10.298358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:13.082593Z","title":null,"venue":null,"work_id":"11d5f461-bb33-40b0-9569-eb1e10702e2b","year":1955},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":1932,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.306580Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:fcce91c9640bcd5614f86c434cf001e7e775a4a0293a3e23c5b4823fb3119de5","observation_id":"81ffb6bc-c061-4c86-96d1-c38e50e59701","resolution":{"observed_at":"2026-08-07T14:52:13.179783Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 3 inbound Pith citation observations for arXiv:2505.17316."}