{"as_of":"2026-08-21T12:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e3bde2aa2a54d588ff7de71f12622c6d1f55d3c0153d2ed79cf1bf0c1b14b3cd","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:29:00.857489Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T06:21:57.229717Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T08:06:48.286226Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"cited_work":{"arxiv_id":"2505.12884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12884","snapshot_observed_at":"2026-07-02T08:06:48.286226Z","title":"Tinyalign: Boosting lightweight vision-language models by mitigating modal alignment bottlenecks.arXiv preprint arXiv:2505.12884, 2025","venue":null,"work_id":"036a942b-ab98-4bef-b506-e1c6655bf600","year":2025},"citing_paper":{"arxiv_id":"2604.26614","last_updated":"2026-04-29T12:41:39Z","snapshot_observed_at":"2026-08-11T13:51:24.959545Z","submitted_at":"2026-04-29T12:41:39Z","title":"State Beyond Appearance: Diagnosing and Improving State Consistency in Dial-Based Measurement Reading","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-07T11:45:57.291112Z"},"links":{"cited_paper":"/paper/2505.12884","citing_paper":"/paper/2604.26614"},"observation_digest":"sha256:aa8e2f10a82654acce98bc8486ef86b08e383c9571aaf2ac5b56db231a0ceac1","observation_id":"91f75623-e115-441a-a03a-7c14efbec075","resolution":{"observed_at":"2026-05-12T09:16:26.486082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"cited_work":{"arxiv_id":"2505.12884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12884","snapshot_observed_at":"2026-07-02T08:06:48.286226Z","title":"Tinyalign: Boosting lightweight vision-language models by mitigating modal alignment bottlenecks.arXiv preprint arXiv:2505.12884, 2025","venue":null,"work_id":"036a942b-ab98-4bef-b506-e1c6655bf600","year":2025},"citing_paper":{"arxiv_id":"2606.04627","last_updated":"2026-06-06T08:34:56Z","snapshot_observed_at":"2026-08-15T06:42:01.332033Z","submitted_at":"2026-06-03T09:01:24Z","title":"MIRAGE: Mobile Agents with Implicit Reasoning and Generative World Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T06:21:57.229717Z"},"links":{"cited_paper":"/paper/2505.12884","citing_paper":"/paper/2606.04627"},"observation_digest":"sha256:6fb2c381d93e9c8ff267ac43d6649317664dd8e8ef6fbd594911a058a120824d","observation_id":"399f5aae-6630-4ac6-8a9d-6f7ef1c7b06b","resolution":{"observed_at":"2026-07-02T08:06:48.287812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.12884/citation-record","integrity":"/paper/2505.12884/integrity","json":"/paper/2505.12884/citation-record.json","paper":"/paper/2505.12884"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1505.00468","last_updated":"2016-10-27T03:50:19Z","snapshot_observed_at":"2026-08-15T14:20:20.896398Z","submitted_at":"2015-05-03T20:07:39Z","title":"VQA: Visual Question Answering","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.00468","snapshot_observed_at":"2026-08-15T20:29:00.619046Z","title":"Lawrence Zitnick, Dhruv Batra, and Devi Parikh","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.619046Z"},"links":{"cited_paper":"/paper/1505.00468","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:d89dd6d90e4b231f200f9d80e39dd27921a18c1f3e6c330860038d458ad2cf4f","observation_id":"17423ce2-1c98-46ea-bc8e-c625dc1f694d","resolution":{"observed_at":"2026-08-15T20:29:00.619046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:00.625655Z","title":"Qwen2.5-vl technical report,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.625655Z"},"links":{"citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:dc9b5e89d46b8dace7394f9a20f36332e672cce1e0d8961b261a29bbd6f648ea","observation_id":"8d0877ac-da7a-43fa-98de-8d171c4f7b55","resolution":{"observed_at":"2026-08-15T20:29:00.625655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15406","last_updated":"2024-05-22T07:15:18Z","snapshot_observed_at":"2026-08-21T09:13:40.343831Z","submitted_at":"2024-04-23T18:00:09Z","title":"Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15406","snapshot_observed_at":"2026-08-15T20:29:00.635210Z","title":"Wiki-llava: Hierarchical retrieval-augmented generation for multimodal llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.635210Z"},"links":{"cited_paper":"/paper/2404.15406","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:a27ec866d7af0d2ac68e202bda16d35f2167299c4d18125f53590a21b6b6900d","observation_id":"bcfed123-2fa0-4f4e-bbd7-6477c3840119","resolution":{"observed_at":"2026-08-15T20:29:00.635210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-15T20:29:00.640172Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.640172Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:691aaaf4149977494df55222acf78a89691d2ee3a6bb345b49f888d992122487","observation_id":"d9fa5af5-c52d-480a-8a9d-e0567dd8aef1","resolution":{"observed_at":"2026-08-15T20:29:00.640172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02928","last_updated":"2022-10-20T17:16:27Z","snapshot_observed_at":"2026-08-16T16:26:25.299447Z","submitted_at":"2022-10-06T13:58:03Z","title":"MuRAG: Multimodal Retrieval-Augmented Generator for Open Question Answering over Images and Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02928","snapshot_observed_at":"2026-08-15T20:29:00.645102Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.645102Z"},"links":{"cited_paper":"/paper/2210.02928","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:502dcc08c18689734096a64a1b3629f73e514f9c680d228b1180fb23b5640cbb","observation_id":"c997b720-00aa-4e76-9925-05d62ceae7a3","resolution":{"observed_at":"2026-08-15T20:29:00.645102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-07T07:27:51.369423Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18565","snapshot_observed_at":"2026-08-15T20:29:00.649803Z","title":"Pali-x: On scaling up a multilingual vision and language model, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.649803Z"},"links":{"cited_paper":"/paper/2305.18565","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:f863087fe9e021f5f13e761caf972b18326e8109117a36d4f682c02fb44fbf0c","observation_id":"db5099d1-eb24-4893-9da6-e7a368e8a19f","resolution":{"observed_at":"2026-08-15T20:29:00.649803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-15T20:29:00.654472Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.654472Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:2240a8cd1a2fdab30dbce2fde9b97fc36e13c5e4702bc4d070a2094f84e6376a","observation_id":"f06f3a30-c59a-47f0-8b96-75633590212f","resolution":{"observed_at":"2026-08-15T20:29:00.654472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:00.659368Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.659368Z"},"links":{"citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:43faa6b47d1d13c1575ce2513c6382489f8ec27621a3a2fa42aee2fc774cb612","observation_id":"a037dd18-e019-4312-93dd-6f16cbe51263","resolution":{"observed_at":"2026-08-15T20:29:00.659368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:01.761138Z","title":"Mobilevlm : A fast, strong and open vision language assistant for mobile devices, 2023","venue":null,"work_id":"54f14977-980a-4bd5-bd94-dbedabe18f79","year":2023},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.663733Z"},"links":{"citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:9d34246090b62e97393a083a0273b168d0fea7a646bee344e892aef60398f9c2","observation_id":"17d0cfc0-9276-4d20-a138-1a11debebd1f","resolution":{"observed_at":"2026-08-15T20:29:01.765899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-20T12:23:13.963013Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-15T20:29:00.667908Z","title":"Mobilevlm v2: Faster and stronger baseline for vision language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.667908Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:c1e7833fd1a9eb39094e49ed970b3a3312ba1a831cb7a06574ef9149ce675df2","observation_id":"101b1fda-e4a3-45f6-830c-d9d6c6e6a498","resolution":{"observed_at":"2026-08-15T20:29:00.667908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-15T20:29:00.672424Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.672424Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:9410bd55f8a443d2b1fd999e2ac27ebef42204afd293bd62ce2c991b3f83e70c","observation_id":"3caa645b-1b7b-4081-bfb4-d1166f4f2118","resolution":{"observed_at":"2026-08-15T20:29:00.672424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:01.746827Z","title":"Gemini 2.5 pro","venue":null,"work_id":"a462423e-95a4-4419-b0da-7b0a2ce276de","year":2024},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.676928Z"},"links":{"citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:f5a53316fcd4c1ef56ea4d2cfd72572e8a4901f2cfa048bb834df6ff6842162d","observation_id":"414db313-0a32-49d8-a669-26395d368f6f","resolution":{"observed_at":"2026-08-15T20:29:01.751247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-08-13T11:19:55.436754Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-15T20:29:00.681459Z","title":"Textbooks are all you need, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.681459Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:e4b7455e45ece31b8a0f5c9bd9de4b6852f09ae00350917a3d285c55059c7ba8","observation_id":"d6a7ea5e-b73f-4d0f-a3fc-efdfc9442a08","resolution":{"observed_at":"2026-08-15T20:29:00.681459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08909","last_updated":"2020-02-10T18:40:59Z","snapshot_observed_at":"2026-08-02T17:52:27.326803Z","submitted_at":"2020-02-10T18:40:59Z","title":"REALM: Retrieval-Augmented Language Model Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08909","snapshot_observed_at":"2026-08-15T20:29:00.685893Z","title":"Realm: Retrieval-augmented language model pre-training, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.685893Z"},"links":{"cited_paper":"/paper/2002.08909","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:dddd8d375efdf3d66566b29e6b4f4d45c65ba14a47cad7ee2834b8dabd912da2","observation_id":"78006af3-1525-4be9-8d31-d35166d21960","resolution":{"observed_at":"2026-08-15T20:29:00.685893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05221","last_updated":"2023-04-03T08:32:39Z","snapshot_observed_at":"2026-08-20T12:23:54.205104Z","submitted_at":"2022-12-10T06:17:56Z","title":"REVEAL: Retrieval-Augmented Visual-Language Pre-Training with Multi-Source Multimodal Knowledge Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05221","snapshot_observed_at":"2026-08-15T20:29:00.690357Z","title":"Ross, and Alireza Fathi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.690357Z"},"links":{"cited_paper":"/paper/2212.05221","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:3e6cf9987257f08b669cc85b075ee687fcdf8b49dfa1a949aec531acbd9464b0","observation_id":"8f8585da-60de-4eda-ba67-4194516204cc","resolution":{"observed_at":"2026-08-15T20:29:00.690357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.09506","last_updated":"2019-05-10T22:24:55Z","snapshot_observed_at":"2026-08-21T04:47:29.872924Z","submitted_at":"2019-02-25T18:37:49Z","title":"GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.09506","snapshot_observed_at":"2026-08-15T20:29:00.694735Z","title":"Hudson and Christopher D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.694735Z"},"links":{"cited_paper":"/paper/1902.09506","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:9e487dfe9f05977311ed984476c6fb7353d7937ff5c7db0d9dcbf62ee9c0c500","observation_id":"99d990e4-5bd0-415d-8b23-e28e0f3b4ca3","resolution":{"observed_at":"2026-08-15T20:29:00.694735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14795","last_updated":"2022-03-15T22:37:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-30T17:53:34Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14795","snapshot_observed_at":"2026-08-15T20:29:00.699178Z","title":"Botvinick, Andrew Zisserman, Oriol Vinyals, and Jo¯ao Carreira","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.699178Z"},"links":{"cited_paper":"/paper/2107.14795","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:76a02079ff8b94e65b00aac68a554887f5e60ab7001f134c19c9b2e3459ee700","observation_id":"d7c724d8-f52b-4e25-b3d6-1a91f9b97cbe","resolution":{"observed_at":"2026-08-15T20:29:00.699178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:00.703771Z","title":"Shamma, Michael S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.703771Z"},"links":{"citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:38169f37f614f68886f488f0d5a55f594c7e279e6c856a1b7b47fc0159d702c7","observation_id":"f9cf1c9b-9f00-4669-b44e-663f1c5293ec","resolution":{"observed_at":"2026-08-15T20:29:00.703771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11401","last_updated":"2021-04-12T15:42:18Z","snapshot_observed_at":"2026-08-07T05:44:30.677502Z","submitted_at":"2020-05-22T21:34:34Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11401","snapshot_observed_at":"2026-08-15T20:29:00.713032Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.713032Z"},"links":{"cited_paper":"/paper/2005.11401","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:77437fec332755dd771f7f8f944f9c0a3b7be39e089989a52caca6e1231968ed","observation_id":"853b2d3a-5d30-45ca-8faf-b93b928485f0","resolution":{"observed_at":"2026-08-15T20:29:00.713032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-20T12:00:24.760146Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-15T20:29:00.717547Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.717547Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:b2a1a029886414aa5ea8410d6612bb76d2bbe0d5276ba30f3e271eb7eb70c019","observation_id":"dd7b7c76-4726-4ae3-ad80-7658c70ac71d","resolution":{"observed_at":"2026-08-15T20:29:00.717547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-15T20:29:00.721878Z","title":"Evaluating object hallucination in large vision-language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.721878Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:a1c11af5a087ad1787c99ac05c4305b41147592090ac889e1c7b35f6fb7a4a20","observation_id":"764c23cc-2f56-47b9-b429-e88c47322572","resolution":{"observed_at":"2026-08-15T20:29:00.721878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-08-21T02:14:04.953864Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-08-15T20:29:00.726221Z","title":"Lawrence Zitnick, and Piotr Dollár","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.726221Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:85e3be694b8dc5f078065e67848e4da346416b3d328d53fd35114a1a8b4c59f4","observation_id":"d72b8153-57be-44dc-84c1-dc9d15de91d2","resolution":{"observed_at":"2026-08-15T20:29:00.726221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-15T20:29:00.730662Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.730662Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:2ecd0d0f65ab8390640e5bb7e47d40aadc743bc29af959f22bbef170ce3e6126","observation_id":"e79af00c-92e7-4e2b-9aab-c4ec141b1565","resolution":{"observed_at":"2026-08-15T20:29:00.730662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.07773","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:01.359260Z","title":"Point- wise mutual information as a performance gauge for retrieval-augmented generation, 2025","venue":null,"work_id":"28ac8b23-e39a-4a67-b8bf-19731f9e78f7","year":2025},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.735148Z"},"links":{"citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:56758f6732d81594b6ea33757c396fc05b92b2588bb736404227020f2feeb918","observation_id":"879c424e-e4c7-45a4-a6e1-0adc31de3757","resolution":{"observed_at":"2026-08-15T20:29:01.368487Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-19T16:22:29.898436Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-15T20:29:00.739181Z","title":"Deepseek-vl: Towards real-world vision-language understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.739181Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:f5c747861febfd57de28395dfa6cbdb4198d5ad69b02e16e3e339ff2019e9385","observation_id":"72fe669f-d46a-4d72-a2d6-9d16ff34f469","resolution":{"observed_at":"2026-08-15T20:29:00.739181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.09513","last_updated":"2022-10-17T07:46:47Z","snapshot_observed_at":"2026-08-19T12:38:24.427894Z","submitted_at":"2022-09-20T07:04:24Z","title":"Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.09513","snapshot_observed_at":"2026-08-15T20:29:00.743702Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.743702Z"},"links":{"cited_paper":"/paper/2209.09513","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:75f7480e41ac087b08b4b9b8478801e1752850dd3d7a7d5ce3f81e0f0e8ba5ef","observation_id":"85aa9fa2-cfed-4aa6-99dd-34df8b582aae","resolution":{"observed_at":"2026-08-15T20:29:00.743702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-08-15T20:29:00.748073Z","title":"Smolvlm: Redefining small and efficient multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.748073Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:33b42fd211a74a1c5ea8c9cdac13a534c81fdb424d9375f5c649c27fad7f0fd3","observation_id":"759b2e2e-f58f-4c2d-be5c-1452ae44d473","resolution":{"observed_at":"2026-08-15T20:29:00.748073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:00.753362Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.753362Z"},"links":{"citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:59e075508b3ed394bbbc7a020d0563d5bce4b1e6c039429b7297621821afe3d0","observation_id":"9fdae919-19ba-4e1b-abe4-2ab4e59c52b7","resolution":{"observed_at":"2026-08-15T20:29:00.753362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:01.714560Z","title":"Gpt-4v(ision)","venue":null,"work_id":"51dac4c9-c447-48bb-a485-47c189247414","year":2023},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.757644Z"},"links":{"citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:0fb37df2c67a2041116a15fb376138ee882583b3ca4ae1b013b943f76bf06610","observation_id":"d539910f-4a09-4521-a15c-47d3136685de","resolution":{"observed_at":"2026-08-15T20:29:01.719005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-15T20:29:00.761875Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.761875Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:3f0866de15feef7ae18a867b8354912f34a4cd33d007fc098e4e5222de414115","observation_id":"5ef47174-c9a0-447f-a995-ff7392f94ef9","resolution":{"observed_at":"2026-08-15T20:29:00.761875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19150","last_updated":"2024-06-27T13:08:35Z","snapshot_observed_at":"2026-08-16T13:39:05.241367Z","submitted_at":"2024-06-27T13:08:35Z","title":"RAVEN: Multitask Retrieval Augmented Vision-Language Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19150","snapshot_observed_at":"2026-08-15T20:29:00.766553Z","title":"Raven: Multitask retrieval augmented vision-language learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.766553Z"},"links":{"cited_paper":"/paper/2406.19150","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:eaa124a20218e7b3fc44dad91722d8c66538573688e89fb76413238d31681e54","observation_id":"6c30541f-9455-485b-b606-ccaf926af4d4","resolution":{"observed_at":"2026-08-15T20:29:00.766553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08920","last_updated":"2019-05-13T23:28:48Z","snapshot_observed_at":"2026-08-16T14:34:13.145148Z","submitted_at":"2019-04-18T17:55:37Z","title":"Towards VQA Models That Can Read","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08920","snapshot_observed_at":"2026-08-15T20:29:00.770958Z","title":"Towards vqa models that can read, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.770958Z"},"links":{"cited_paper":"/paper/1904.08920","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:59888c04a4c2551516c5ccefc817cf46ec8aaef2faab9f5ef7d7b3f6dae33430","observation_id":"be98cfda-dbbc-475b-8a6e-c0e5178bbff5","resolution":{"observed_at":"2026-08-15T20:29:00.770958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-08-15T20:29:00.775359Z","title":"Paligemma 2: A family of versatile vlms for transfer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.775359Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:e414c292b4f09790555cb4cb8befd694bf2b650cbc86b8049c91fe0b6fc1c4a8","observation_id":"3daacc28-d331-4ac0-b8bc-c2aa4291442e","resolution":{"observed_at":"2026-08-15T20:29:00.775359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-21T05:15:28.840279Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-15T20:29:00.779952Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.779952Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:5b9b0315d53648bacbf3c02a197c2f0bd209a337e3c7ff406be1a1cfeed89b13","observation_id":"c3221ba2-7151-4036-8104-4cd6a51fa574","resolution":{"observed_at":"2026-08-15T20:29:00.779952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07795","last_updated":"2022-10-14T13:26:41Z","snapshot_observed_at":"2026-08-19T23:39:47.954954Z","submitted_at":"2022-10-14T13:26:41Z","title":"EfficientVLM: Fast and Accurate Vision-Language Models via Knowledge Distillation and Modal-adaptive Pruning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07795","snapshot_observed_at":"2026-08-15T20:29:00.784329Z","title":"Efficientvlm: Fast and accurate vision-language models via knowledge distillation and modal-adaptive pruning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.784329Z"},"links":{"cited_paper":"/paper/2210.07795","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:e09ca8eed559cf48379f711a9e68e9e79b489dab337c73492e7c2a816a9112e4","observation_id":"ec7adb78-2727-4cd2-9c35-50dfbccecd1f","resolution":{"observed_at":"2026-08-15T20:29:00.784329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-15T20:29:00.788737Z","title":"Qwen2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.788737Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:604f564be8d9d7fb72feb18e0e29685990a00d40619a5b727d71761c2cfe4dba","observation_id":"cee69c63-a57a-489d-8135-9eac5b7e8e90","resolution":{"observed_at":"2026-08-15T20:29:00.788737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-08-16T13:20:46.785210Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-15T20:29:00.793040Z","title":"Mm-react: Prompting chatgpt for multimodal reasoning and action, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.793040Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:dc1773690ef5f035283bc7879776c3f171cd75cad7ae2ad066b92e0481bcf0f5","observation_id":"b86a3b35-185a-4c2c-ae1f-3f5ce8acc723","resolution":{"observed_at":"2026-08-15T20:29:00.793040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04858","last_updated":"2023-10-22T04:18:00Z","snapshot_observed_at":"2026-08-16T15:56:26.819695Z","submitted_at":"2023-02-09T18:57:56Z","title":"Re-ViLM: Retrieval-Augmented Visual Language Model for Zero and Few-Shot Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04858","snapshot_observed_at":"2026-08-15T20:29:00.797269Z","title":"Re-vilm: Retrieval-augmented visual language model for zero and few-shot image captioning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.797269Z"},"links":{"cited_paper":"/paper/2302.04858","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:724f1f73e0c6940acd097b2a795a30e03779c5f346630337666e7eed8b15e849","observation_id":"9f60531d-8572-426c-85da-3cecabbd1a48","resolution":{"observed_at":"2026-08-15T20:29:00.797269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-08-21T07:48:51.700518Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-15T20:29:00.802227Z","title":"Minicpm-v: A gpt-4v level mllm on your phone, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.802227Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:343414ae61b86af0f3426ddef5dc9150b859fe5b458d7ca334a6e49c9a112390","observation_id":"da051eb0-143d-4b78-bede-60924f29f9d2","resolution":{"observed_at":"2026-08-15T20:29:00.802227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:00.807099Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.807099Z"},"links":{"citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:803113bc0f11689a0a2f502bdbff33e04851a0c984a8b210322d5ebd0babf8ab","observation_id":"712c6821-28db-4cc7-b483-c60dca22bc09","resolution":{"observed_at":"2026-08-15T20:29:00.807099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16862","last_updated":"2024-06-21T07:08:59Z","snapshot_observed_at":"2026-08-19T13:39:19.209645Z","submitted_at":"2023-12-28T07:11:41Z","title":"TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16862","snapshot_observed_at":"2026-08-15T20:29:00.816370Z","title":"Tinygpt-v: Efficient multimodal large language model via small backbones, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.816370Z"},"links":{"cited_paper":"/paper/2312.16862","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:a93e19337cbd8819c927bf534bf942a6647cc2be305463113aae7d576c4e55c7","observation_id":"fc9c2421-bdfc-4a44-8d2c-c23003f191a2","resolution":{"observed_at":"2026-08-15T20:29:00.816370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-08-17T13:10:52.611064Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-15T20:29:00.821907Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.821907Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:688ab71c36a1257e32eff35f050a917931ceefdce473e4a4d67b5f2295613daf","observation_id":"457d5fda-bf1a-4599-8837-7db06a02aed1","resolution":{"observed_at":"2026-08-15T20:29:00.821907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-15T20:29:00.826402Z","title":"Sigmoid loss for language image pre-training, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.826402Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:a891d6f62942492149be2e1773e7f65a6c804ef88580a09b4835987c330df72a","observation_id":"98bed36d-456d-43b7-b39b-f44754420ebd","resolution":{"observed_at":"2026-08-15T20:29:00.826402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-15T20:29:00.830987Z","title":"Tinyllama: An open-source small language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.830987Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:958faf8619be27ad1a22d824d87a0032e16797d03931736030fc777cfdfa1103","observation_id":"64a5700f-aa9e-4f8a-ab4c-24ed3fb7e4b8","resolution":{"observed_at":"2026-08-15T20:29:00.830987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14289","last_updated":"2024-02-22T05:05:30Z","snapshot_observed_at":"2026-08-19T20:26:10.685439Z","submitted_at":"2024-02-22T05:05:30Z","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14289","snapshot_observed_at":"2026-08-15T20:29:00.835548Z","title":"Tinyllava: A framework of small-scale large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.835548Z"},"links":{"cited_paper":"/paper/2402.14289","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:95672038f757ebd5b21a1f357ba8f8adff61e987856d7559cca0721eaa1569ae","observation_id":"ded0f26c-3587-4a35-8141-f6dcf6067529","resolution":{"observed_at":"2026-08-15T20:29:00.835548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-15T20:29:00.839816Z","title":"Minigpt-4: En- hancing vision-language understanding with advanced large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.839816Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:a16d10ef6a3eef3fe1774580f1976f17036cdfc451d63e1398fa45c84ebfcdb3","observation_id":"bc2613ff-a37e-4026-9bb3-3bfc7e3bd045","resolution":{"observed_at":"2026-08-15T20:29:00.839816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:00.844243Z","title":"An information bottleneck perspective for effective noise filtering on retrieval-augmented generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.844243Z"},"links":{"citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:e1e8364428def0fea6097394bd2c5bfbf6a26fcd5bae6e660cfd0c30876c4a0c","observation_id":"d6466768-7743-4596-92a9-18ce65fe1979","resolution":{"observed_at":"2026-08-15T20:29:00.844243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:01.691386Z","title":"These represent visual information conditioned for the language model","venue":null,"work_id":"cccf4d4c-d942-48b6-9801-34d11a1b0bf7","year":null},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.848639Z"},"links":{"citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:6c871ce3dae5c4fc4cb84504bb081a4bc7f5fd104f216a81df155058d8311f6b","observation_id":"d4014949-d4e8-4044-850f-cf6f2fd72180","resolution":{"observed_at":"2026-08-15T20:29:01.695970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:01.677002Z","title":"This 2D representation facilitates direct scatter plot visualization","venue":null,"work_id":"779a9b9b-5c8e-45d8-9fb8-63585832a7f9","year":null},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.853070Z"},"links":{"citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:457e634659a7e8e4d19c40a3e5fcaa2d193ba17caa85bf6681dcf666184232e8","observation_id":"36e726cb-f81e-4f96-8a6d-e420dfa1ceef","resolution":{"observed_at":"2026-08-15T20:29:01.681750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:01.662056Z","title":"collapse","venue":null,"work_id":"ea988665-b9dc-42ea-a647-40559f405b6f","year":null},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.857489Z"},"links":{"citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:c201c6828a5412be8ed648dfa6fe7d8e1b06ee82d0a08019ba86a7213b117fe3","observation_id":"2a049c74-ba2b-4755-b3c6-a872dc2f4962","resolution":{"observed_at":"2026-08-15T20:29:01.666764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.07332","last_updated":"2016-02-23T22:00:40Z","snapshot_observed_at":"2026-08-14T22:09:05.495219Z","submitted_at":"2016-02-23T22:00:40Z","title":"Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.07332","snapshot_observed_at":"2026-08-15T20:29:00.708324Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.708324Z"},"links":{"cited_paper":"/paper/1602.07332","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:f7dcd9a09b624e2beffe39d6a3f3db8f66b8f75e4caca4eef1e73834fb3ce088","observation_id":"52b124eb-2aef-4505-bf89-483acc3aa074","resolution":{"observed_at":"2026-08-15T20:29:00.708324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-21T04:07:07.949331Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-15T20:29:00.811211Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.811211Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:50315edd3765a115f92a441cf21e870c29a1b06c15da2e62e6ea94862f29afda","observation_id":"e8f784a9-3a21-41e6-9ef8-5ee0c5934deb","resolution":{"observed_at":"2026-08-15T20:29:00.811211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T20:29:00.630220Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:00.630220Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.12884"},"observation_digest":"sha256:fa468661c41e20668ebdef58562b4ec0f19cc1ec62ffe661194d8016ebec33c5","observation_id":"b19ecd5e-7791-4e40-abc4-6c62ef150b4f","resolution":{"observed_at":"2026-08-15T20:29:00.630220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.12884","last_updated":"2025-06-30T08:29:25Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T15:55:47.747774Z","submitted_at":"2025-05-19T09:11:54Z","title":"TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":1,"verified_fuzzy":6},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 2 inbound Pith citation observations for arXiv:2505.12884."}