{"as_of":"2026-08-23T22:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fd2e931ff17fb54ef7e6c06107ae1cc932cc2f0b329355a5c638efb01ede34cf","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:35:05.203103Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T08:39:20.202572Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T08:39:53.356638Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"cited_work":{"arxiv_id":"2502.07838","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07838","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nanovlms: How small can we go and still make coherent vision language models?","venue":null,"work_id":"0ac553d8-fe13-4ffa-ae94-8803c4806b10","year":2025},"citing_paper":{"arxiv_id":"2604.11530","last_updated":"2026-07-08T19:47:09Z","snapshot_observed_at":"2026-08-12T12:06:34.719950Z","submitted_at":"2026-04-13T14:30:13Z","title":"Beyond Attention Scores: SVD-Based Vision Token Pruning for Efficient Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T16:27:58.757680Z"},"links":{"cited_paper":"/paper/2502.07838","citing_paper":"/paper/2604.11530"},"observation_digest":"sha256:d19686ac8c152eb05dc8387b49717a4682a08c39e71f6b1896069842c3c0e198","observation_id":"3451ea62-21e4-4270-945a-86045c4c1d51","resolution":{"observed_at":"2026-05-11T08:50:58.510682Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"cited_work":{"arxiv_id":"2502.07838","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07838","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nanovlms: How small can we go and still make coherent vision language models?","venue":null,"work_id":"0ac553d8-fe13-4ffa-ae94-8803c4806b10","year":2025},"citing_paper":{"arxiv_id":"2604.11530","last_updated":"2026-07-08T19:47:09Z","snapshot_observed_at":"2026-08-12T12:06:34.719950Z","submitted_at":"2026-04-13T14:30:13Z","title":"Beyond Attention Scores: SVD-Based Vision Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T08:39:20.202572Z"},"links":{"cited_paper":"/paper/2502.07838","citing_paper":"/paper/2604.11530"},"observation_digest":"sha256:7390c4caa4fde2d0b10e4c753cfbc1c8b47f5b9fd0e3199a642114bbc7de75e4","observation_id":"3efb266f-0772-4aba-94f0-7737a9b03026","resolution":{"observed_at":"2026-05-21T08:39:53.358666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07838/citation-record","integrity":"/paper/2502.07838/integrity","json":"/paper/2502.07838/citation-record.json","paper":"/paper/2502.07838"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1803.08375","last_updated":"2026-04-14T12:21:53Z","snapshot_observed_at":"2026-08-14T20:09:04.632955Z","submitted_at":"2018-03-22T14:30:17Z","title":"Deep Learning using Rectified Linear Units (ReLU)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.08375","snapshot_observed_at":"2026-08-08T13:35:05.020270Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.020270Z"},"links":{"cited_paper":"/paper/1803.08375","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:f74e5d90fa975ed7b9cbe48b54891791e07087f8ad1cd8384363dfb9671035d9","observation_id":"71ab9b5c-603c-4583-ab3d-1199acd0d0ba","resolution":{"observed_at":"2026-08-08T13:35:05.020270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:05.025112Z","title":"L., and Parikh, D","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.025112Z"},"links":{"citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:0f14d16412cee5a7681e4299063a7371dc6956b086cf2dd61468ddd96eefe534","observation_id":"b8ff9256-8223-44e1-81fe-b2a325854594","resolution":{"observed_at":"2026-08-08T13:35:05.025112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09879","last_updated":"2025-06-18T19:19:17Z","snapshot_observed_at":"2026-08-16T13:34:31.742975Z","submitted_at":"2024-07-13T13:03:45Z","title":"sPhinX: Sample Efficient Multilingual Instruction Fine-Tuning Through N-shot Guided Prompting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09879","snapshot_observed_at":"2026-08-08T13:35:05.029759Z","title":"H., Patra, B., Aggarwal, K., Corro, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.029759Z"},"links":{"cited_paper":"/paper/2407.09879","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:c7cce005dcd979f1837f57aac404cf1d1d61b9dad3e303c4c35afe216c455b73","observation_id":"b2f193c3-92e0-4cf1-8802-a265776c2a08","resolution":{"observed_at":"2026-08-08T13:35:05.029759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:06.290858Z","title":"Llama 3: Next-generation open-source language models, 2024","venue":null,"work_id":"11172897-d772-4f67-96d4-857a7b5f2f24","year":2024},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.035068Z"},"links":{"citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:86693fe2fbf4d62ffd49b00d3d1774dc729db9efae836c9a5cebfcd0ca2d74c1","observation_id":"63a6ba0c-1583-47dc-a6f8-4357cc718012","resolution":{"observed_at":"2026-08-08T13:35:06.295163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04856","last_updated":"2023-01-12T07:42:36Z","snapshot_observed_at":"2026-08-16T16:02:56.450013Z","submitted_at":"2023-01-12T07:42:36Z","title":"Multimodal Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04856","snapshot_observed_at":"2026-08-08T13:35:05.039509Z","title":"Multimodal deep learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.039509Z"},"links":{"cited_paper":"/paper/2301.04856","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:a94404f105cd55c5a704418f9edf80bafc6f179be2197c08787a23a8b8d66bda","observation_id":"0867f3ca-0589-4565-8da8-7dfd6f62c1f0","resolution":{"observed_at":"2026-08-08T13:35:05.039509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-08-17T03:00:38.806206Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-08T13:35:05.044985Z","title":"Flamingo: a visual language model for few-shot learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.044985Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:ba3f7230dd0d7873a1eb35b5b0b40f5cc1022c840e7cee559a5aacce685a51ae","observation_id":"cc374f1e-019e-4885-8ded-cd4e36732e6b","resolution":{"observed_at":"2026-08-08T13:35:05.044985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-08T13:35:05.050657Z","title":"L., Kiros, J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.050657Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:eda9a9b9b79c054e4f8b573d9eb5e620b262f82c9f6bed9a4824f0afa9293a7a","observation_id":"41bf2048-cca2-4962-938a-ed8b5fc32f3f","resolution":{"observed_at":"2026-08-08T13:35:05.050657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06742","last_updated":"2024-04-01T03:00:06Z","snapshot_observed_at":"2026-08-18T02:59:31.716529Z","submitted_at":"2023-12-11T18:59:06Z","title":"Honeybee: Locality-enhanced Projector for Multimodal LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06742","snapshot_observed_at":"2026-08-08T13:35:05.055236Z","title":"Honeybee: Locality-enhanced projector for multimodal llm, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.055236Z"},"links":{"cited_paper":"/paper/2312.06742","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:f340f44dffeabf7f3e09900ed162899d30d6e9f2f56a07d83a52d773771365f1","observation_id":"762b3e11-3891-419b-8f55-6a9306fbeb64","resolution":{"observed_at":"2026-08-08T13:35:05.055236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-20T14:30:51.079652Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-08T13:35:05.059823Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.059823Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:d83fd995da8b4d341e594b1f19eabe1a0f10c2f388b1f4783b0d4ffe396f2e1d","observation_id":"f137f531-b55f-4569-af54-2a5d362987e9","resolution":{"observed_at":"2026-08-08T13:35:05.059823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07759","last_updated":"2023-05-24T23:30:43Z","snapshot_observed_at":"2026-08-20T14:47:29.320021Z","submitted_at":"2023-05-12T20:56:48Z","title":"TinyStories: How Small Can Language Models Be and Still Speak Coherent English?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07759","snapshot_observed_at":"2026-08-08T13:35:05.064299Z","title":"and Li, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.064299Z"},"links":{"cited_paper":"/paper/2305.07759","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:b786219052fcdc1cdce078794a96a7d5126e543eec1b833899d4deeb0355d80d","observation_id":"63b43545-9a26-4b86-9c12-b70c4087ab7c","resolution":{"observed_at":"2026-08-08T13:35:05.064299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:06.274812Z","title":"Vision-language pretraining: Bridging vision and language with transformers, 2023","venue":null,"work_id":"2d9a5e8d-11ba-47ff-9421-df400e2afcfb","year":2023},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.068784Z"},"links":{"citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:8dcfab9f7d9451353d4d9d602ffb267a6362149f742b0af58664258d442808ed","observation_id":"ccd4f1d9-8243-43bb-b9d4-7255dd799adb","resolution":{"observed_at":"2026-08-08T13:35:06.279804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:05.073217Z","title":"Exploring the frontier of vision-language models: A survey of current methodologies and future directions, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.073217Z"},"links":{"citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:1af62f8dd5099ab0f4b55ea22c0110182bd62ce6ee5c83685ec9149be82621a2","observation_id":"d225a2d6-c379-4880-92a0-457c957231e0","resolution":{"observed_at":"2026-08-08T13:35:05.073217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14233","last_updated":"2023-12-21T18:49:47Z","snapshot_observed_at":"2026-08-16T14:32:28.122739Z","submitted_at":"2023-12-21T18:49:47Z","title":"VCoder: Versatile Vision Encoders for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14233","snapshot_observed_at":"2026-08-08T13:35:05.078035Z","title":"Vcoder: Versatile vision encoders for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.078035Z"},"links":{"cited_paper":"/paper/2312.14233","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:b67493db08a75a196f3915bfa937732884f7b9ce3250fa99d435d8b615ca6e16","observation_id":"7d471db5-6a7a-4d2f-9df2-6cb1182a2437","resolution":{"observed_at":"2026-08-08T13:35:05.078035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:06.258903Z","title":"The illustrated gpt-2, 2019","venue":null,"work_id":"9e12b9a1-1b18-4f2a-bc57-e03c83a7ad87","year":2019},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.082807Z"},"links":{"citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:fc9324553619a43ae3691417db23c2ab4bf667bc328abcf25f6507b60e69f505","observation_id":"b4b542eb-68eb-4b8f-92f2-ed0cde7ced25","resolution":{"observed_at":"2026-08-08T13:35:06.263411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07204","last_updated":"2024-04-10T17:59:45Z","snapshot_observed_at":"2026-08-18T18:37:21.980508Z","submitted_at":"2024-04-10T17:59:45Z","title":"BRAVE: Broadening the visual encoding of vision-language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07204","snapshot_observed_at":"2026-08-08T13:35:05.087875Z","title":"F., Tonioni, A., Poklukar, P., Kulshrestha, A., Zamir, A., and Tombari, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.087875Z"},"links":{"cited_paper":"/paper/2404.07204","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:c108fd8926864173acf1b6efd4c51479917dd29df2c72e294d7b58448edce6fa","observation_id":"59305fb5-9d11-45e6-aa55-6f55bdb4bcfd","resolution":{"observed_at":"2026-08-08T13:35:05.087875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-20T06:46:31.583175Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-08T13:35:05.092936Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.092936Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:9ffad14cef14701de04e3bad08e492a48c083f5844e0a253650804d51d450839","observation_id":"cac67ee3-c85f-4987-94ab-a04fdde58d7d","resolution":{"observed_at":"2026-08-08T13:35:05.092936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:06.243761Z","title":null,"venue":null,"work_id":"97afcbc3-e505-4f56-b357-f9df8cb840ce","year":2014},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.098193Z"},"links":{"citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:16a3af365f665ffb92b4a649283745be3fe90d526bd82a3cc2e73c17dc108901","observation_id":"c98324ae-7756-4264-8f3b-85c1f443b873","resolution":{"observed_at":"2026-08-08T13:35:06.248245Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:06.229231Z","title":"Forgetful causal masking makes causal language models better few-shot learners","venue":null,"work_id":"348d7560-5cff-418e-86fa-9a32bbfbd2b2","year":2022},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.102625Z"},"links":{"citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:be52b4d513ddb139e92faa3870175fc1951925f0748330455baf873ad51e03e8","observation_id":"fef8db1f-2b17-45b7-9119-613ebd755233","resolution":{"observed_at":"2026-08-08T13:35:06.233533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-08T13:35:05.106822Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.106822Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:d61a45bcebdfb10338599784eea025bc8e9fa69a6a0be9acd1a6bb3fb24be363","observation_id":"a54f062f-5abe-4ce2-9974-3d63de6ba1fc","resolution":{"observed_at":"2026-08-08T13:35:05.106822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12694","last_updated":"2025-02-18T08:49:57Z","snapshot_observed_at":"2026-08-20T19:21:43.962651Z","submitted_at":"2024-10-16T15:54:11Z","title":"VividMed: Vision Language Model with Versatile Visual Grounding for Medicine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12694","snapshot_observed_at":"2026-08-08T13:35:05.111491Z","title":"Vividmed: Vision language model with versatile visual grounding for medicine, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.111491Z"},"links":{"cited_paper":"/paper/2410.12694","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:35e4283de249c9e5fba530bc3ccc8968bc5d13ba1b1228ac32f38fd40b642e35","observation_id":"5ca94c39-6def-411b-bc0b-9dc0efd34585","resolution":{"observed_at":"2026-08-08T13:35:05.111491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:06.213750Z","title":"Chatgpt: A language model for conversational ai","venue":null,"work_id":"ecc3186c-d69c-456b-8c13-7da217fdb0fd","year":2023},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.115922Z"},"links":{"citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:ceecda9ebdd3cbba7b689a13fe21602ea80d35bc921a74120fc53869923fa8b4","observation_id":"045d3b54-74c4-480c-9580-c4bed57dc7ce","resolution":{"observed_at":"2026-08-08T13:35:06.218857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T13:35:05.120292Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.120292Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:36b1de842d54b44a27c123157301c78e1ce8b47c9f59b574204e20f581bf0253","observation_id":"4dd829f7-8f3f-4d3d-aa6b-f424ae3e2575","resolution":{"observed_at":"2026-08-08T13:35:05.120292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:06.199255Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":"6134e851-a544-49dc-a3b1-690f349a5f7a","year":2024},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.124670Z"},"links":{"citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:b35c167d88a002975a8da578a9b6d9674ce6a89b9cf5ad68b8401ed7ed92bfb6","observation_id":"157ff30a-f100-4790-9e5e-f971d487f3b3","resolution":{"observed_at":"2026-08-08T13:35:06.203625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-08T13:35:05.128799Z","title":"Kosmos-2: Grounding multimodal large language models to the world, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.128799Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:b940c863d110a749a186d8d7a4f0b53242f332eb4c0360932cba2044569d9e58","observation_id":"d10d0c34-a4a5-4459-80a1-56fd60c5fa1c","resolution":{"observed_at":"2026-08-08T13:35:05.128799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:05.133195Z","title":"A., Wang, L., Cervantes, C","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.133195Z"},"links":{"citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:9cd59980fd34f1d7315a2cc482c6c8d9892ea3a563dd7927c8f9cb0905b68a08","observation_id":"75f42b9c-4689-459b-851b-e1dbb39ae201","resolution":{"observed_at":"2026-08-08T13:35:05.133195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-08T13:35:05.137172Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., and Sutskever, I","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.137172Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:0caf4a81dfa8e899690dc3fabdcde622139f45ef7929717a0f26fd2d2da59d98","observation_id":"747ca1a0-b68b-4c0d-b0a3-9d1406a98aa4","resolution":{"observed_at":"2026-08-08T13:35:05.137172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/iccv.2017.552","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"An end-to-end trainable neural network for image-based sequence recognition and its application to scene text recognition","venue":null,"work_id":"f1abdf4f-d853-4bf6-b657-6e0caad1ed76","year":2017},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.141271Z"},"links":{"citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:5c66468a5c82a5a92783917780238dc341bfe77da48082a974d8b8079d777256","observation_id":"4b137d05-271b-4c18-89e7-ed5a907054f4","resolution":{"observed_at":"2026-08-08T13:35:05.246056Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00977","last_updated":"2024-10-14T23:15:24Z","snapshot_observed_at":"2026-08-16T13:46:54.220691Z","submitted_at":"2024-06-03T04:17:12Z","title":"Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00977","snapshot_observed_at":"2026-08-08T13:35:05.146089Z","title":"L., and Zou, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.146089Z"},"links":{"cited_paper":"/paper/2406.00977","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:85e61d5fd3a1198423a731b47877af55088768e78f4a76e042055ffecaa50d22","observation_id":"bd7a9c8b-04b3-46e6-acee-abd39ef0c37d","resolution":{"observed_at":"2026-08-08T13:35:05.146089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-08-19T04:42:40.974785Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-08T13:35:05.150365Z","title":"N., Kaiser, L., and Polosukhin, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.150365Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:c668c10237393009cc824de426f08bdccd3d92ffc1c9f957e835d7418e8eded5","observation_id":"2c28946e-cf4c-4d21-9012-ab3a32c1664d","resolution":{"observed_at":"2026-08-08T13:35:05.150365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:05.659235Z","title":"Show and tell: A neural image caption generator","venue":null,"work_id":"fe79f3ff-9f04-4501-acb5-e5015df25d60","year":2015},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.154692Z"},"links":{"citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:e3a671298d312930634070f893f702ab3c4da9700aacfd54522a4a23373e6fe6","observation_id":"5929d016-defc-4bbd-8c10-821905a6b605","resolution":{"observed_at":"2026-08-08T13:35:05.663478Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-20T03:47:10.217701Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-08T13:35:05.159093Z","title":"Git: A generative image-to-text transformer for vision and language, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.159093Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:d71ead95c834849ff0555153d9bc1f57d41c45756088d0285fe43518d0370da4","observation_id":"3db7e792-b817-45ae-a83a-6bbb1ebea96c","resolution":{"observed_at":"2026-08-08T13:35:05.159093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-08T13:35:05.163450Z","title":"Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.163450Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:05fe70e7f1da95f312145f03ea7e62ce023e93465df26ae0c18e2748d6865a98","observation_id":"460e4414-7861-4a94-b4e1-dae41a74b03a","resolution":{"observed_at":"2026-08-08T13:35:05.163450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14072","last_updated":"2024-10-17T22:45:13Z","snapshot_observed_at":"2026-08-21T02:46:40.147262Z","submitted_at":"2024-10-17T22:45:13Z","title":"Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14072","snapshot_observed_at":"2026-08-08T13:35:05.167918Z","title":"Efficient vision-language models by summarizing visual tokens into compact registers, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.167918Z"},"links":{"cited_paper":"/paper/2410.14072","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:e1a710efe12a6b65a7d4176d2c8473ed33e12bd59f37154a8b8a4578c3f83588","observation_id":"e4cab989-0a6d-4dfa-9ae4-4b98aa9cc0e1","resolution":{"observed_at":"2026-08-08T13:35:05.167918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-16T17:13:28.893408Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-08T13:35:05.172373Z","title":"mplug-owl: Modularization empowers large language models with multimodality, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.172373Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:804d727c8177e06f745e2618132410dc2999dff883ab6014ac97011d6e5c3842","observation_id":"76bedbdf-2b86-4d7c-8a64-90f5ac9d5a2d","resolution":{"observed_at":"2026-08-08T13:35:05.172373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04779","last_updated":"2024-02-07T12:01:02Z","snapshot_observed_at":"2026-08-16T14:20:39.152540Z","submitted_at":"2024-02-07T12:01:02Z","title":"StableMask: Refining Causal Masking in Decoder-only Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04779","snapshot_observed_at":"2026-08-08T13:35:05.176959Z","title":"Stablemask: Refining causal masking in decoder-only transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.176959Z"},"links":{"cited_paper":"/paper/2402.04779","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:65825e048d51b6e9281c93ec6369345f4238b6665c756d291dc1d2f24790e923","observation_id":"1ffe2807-6b8b-4513-a546-39fb773b7951","resolution":{"observed_at":"2026-08-08T13:35:05.176959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16862","last_updated":"2024-06-21T07:08:59Z","snapshot_observed_at":"2026-08-21T18:53:55.214754Z","submitted_at":"2023-12-28T07:11:41Z","title":"TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16862","snapshot_observed_at":"2026-08-08T13:35:05.183485Z","title":"Tinygpt-v: Efficient multimodal large language model via small backbones, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.183485Z"},"links":{"cited_paper":"/paper/2312.16862","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:e5e6ac9f3214242605a98e42d6efa3bd7532c6de57dfda3fa86562714117d01f","observation_id":"c455f70b-8ff5-4f81-934d-8489ed68f59a","resolution":{"observed_at":"2026-08-08T13:35:05.183485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-08T13:35:05.188506Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.188506Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:127eb7972538bcc5444c44822a6f65e0282b558bfa1a5057e0696d60a3491c17","observation_id":"7d3ce9ec-023e-454b-88fb-89d1242cb157","resolution":{"observed_at":"2026-08-08T13:35:05.188506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-08T13:35:05.193085Z","title":"P., Zhang, H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.193085Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:4d056dac959cab4e2c92d969ff8caa7ff1c94edbb0896675622355fbc19ab3cc","observation_id":"01582bc1-595c-48a6-8f70-ee75b66b9177","resolution":{"observed_at":"2026-08-08T13:35:05.193085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:05.198092Z","title":"Mini GPT -4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.198092Z"},"links":{"citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:876f8c7345da2fbf1c4517abe7954d0d3af3394f1da8b16362408a2ff068a098","observation_id":"b26d970d-eb97-4f57-9044-4e2cfbf26af6","resolution":{"observed_at":"2026-08-08T13:35:05.198092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:05.203103Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.203103Z"},"links":{"citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:41f621f7d5c6ad0f464cefae17779ddb7da3976e26dfd98c9e2395dfefb16265","observation_id":"2b56ab03-731e-44ae-893b-9516474904e1","resolution":{"observed_at":"2026-08-08T13:35:05.203103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 2 inbound Pith citation observations for arXiv:2502.07838."}