{"as_of":"2026-08-08T05:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d58ea32db516592673e95d9ad6eabba60d87e8aacaaabae03e37ae2852959d0e","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:42:13.979447Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T18:08:56.044278Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:19:31.831734Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"cited_work":{"arxiv_id":"2506.16691","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16691","snapshot_observed_at":"2026-07-04T03:19:31.831734Z","title":"arXiv preprint arXiv:2506.16691 (2025)","venue":null,"work_id":"f6edef53-9fa0-49ae-a9f4-368e46d6a652","year":2025},"citing_paper":{"arxiv_id":"2507.21420","last_updated":"2026-04-28T19:54:45Z","snapshot_observed_at":"2026-08-06T19:44:38.919643Z","submitted_at":"2025-07-29T01:07:09Z","title":"ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-19T03:18:11.993413Z"},"links":{"cited_paper":"/paper/2506.16691","citing_paper":"/paper/2507.21420"},"observation_digest":"sha256:abb74053e2b96798a2891698cd2d88ad5a6079e83bf6ecf32f87668f5696ffe9","observation_id":"29312d64-c8fe-498a-bfda-894e49983ae1","resolution":{"observed_at":"2026-05-19T03:22:01.181799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"cited_work":{"arxiv_id":"2506.16691","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16691","snapshot_observed_at":"2026-07-04T03:19:31.831734Z","title":"arXiv preprint arXiv:2506.16691 (2025)","venue":null,"work_id":"f6edef53-9fa0-49ae-a9f4-368e46d6a652","year":2025},"citing_paper":{"arxiv_id":"2606.20077","last_updated":"2026-06-18T10:52:49Z","snapshot_observed_at":"2026-08-04T07:49:21.370818Z","submitted_at":"2026-06-18T10:52:49Z","title":"The Hidden Evolution of Disguised Visual Context inside the VLM","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-26T18:08:56.044278Z"},"links":{"cited_paper":"/paper/2506.16691","citing_paper":"/paper/2606.20077"},"observation_digest":"sha256:10e87b135018790a9fe358ed54c8ff71ac1a13ae92e47f869f11f5964982408b","observation_id":"a6862ffb-5dcc-4899-848e-b4b0aa1d8cdb","resolution":{"observed_at":"2026-07-04T03:19:31.833880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.16691/citation-record","integrity":"/paper/2506.16691/integrity","json":"/paper/2506.16691/citation-record.json","paper":"/paper/2506.16691"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:42:11.467453Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:11.467453Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:a997230938a002f8a87594d2217e595b6184a78bb0219ae5af4649b06cb84400","observation_id":"9aee4c1c-04f1-4f91-87fa-21060a6a7576","resolution":{"observed_at":"2026-08-06T23:42:11.467453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T23:42:11.568556Z","title":"Flamingo: a visual language model for few-shot learning.ArXiv, abs/2204.14198, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:11.568556Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:c99191d053fc73ac5ca798610029eacc84fb57a5f34af19932e8857ffd115568","observation_id":"5ddc843a-52dd-4c47-bc13-381f8f0a0edb","resolution":{"observed_at":"2026-08-06T23:42:11.568556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:11.685462Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:11.685462Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:aa674829adc53e3d50684f7587e3f13b64d7111546d58445c22dcc5febd64c0b","observation_id":"02645f41-f1cb-41ec-b2a7-d7dea623420d","resolution":{"observed_at":"2026-08-06T23:42:11.685462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:11.820401Z","title":"The claude 3 model family: Opus, sonnet, haiku.Claude-3 Model Card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:11.820401Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:a17204ffc1d058897a326614e665d4b2d779be26aaab719d510d22472039ba97","observation_id":"9dc02497-c659-4e8c-8485-0fe1dc005226","resolution":{"observed_at":"2026-08-06T23:42:11.820401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:11.964755Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:11.964755Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:dc8a4d5d4fd8c2c5bad156d255b66ad60c22067e01c18290eea3855475118cc4","observation_id":"a6e64210-2b0a-4bfd-980a-64efcfea572c","resolution":{"observed_at":"2026-08-06T23:42:11.964755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-06T23:42:12.116980Z","title":"Openflamingo: An open- source framework for training large autoregressive vision-language models.arXiv preprint arXiv:2308.01390, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:12.116980Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:88dff162dc8eda2a13dee6301fe205b9aba1ae6b992e09f5ab117c8f8745e3a6","observation_id":"2c3e6796-1489-41cb-9281-7828da2465a2","resolution":{"observed_at":"2026-08-06T23:42:12.116980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T23:42:12.195256Z","title":"Layer normalization.arXiv preprint arXiv:1607.06450, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:12.195256Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:58956962e2810295423eb0acf13dac412c473a5dc13d3163e5d3e1ce4344abc3","observation_id":"88557c66-ee15-4964-a694-9fe9e21332f9","resolution":{"observed_at":"2026-08-06T23:42:12.195256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T23:42:12.353821Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:12.353821Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:ab77c379f8e4fb0d6942f7ddf628dfdd07e1a0c5c35f55f8fa55f8114857a90a","observation_id":"b14f4bd6-4b83-419e-a955-1f6fc8c0609e","resolution":{"observed_at":"2026-08-06T23:42:12.353821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:14.758393Z","title":"Nltk: the natural language toolkit","venue":null,"work_id":"45a10678-f21b-40e9-bea7-dfe84bb69771","year":2006},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:12.478544Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:1224d3c9d5246e8d76228eb470bf3acf98e08f66bba3d5d6cb27b0917bd1eb0e","observation_id":"20014592-ddc7-4c9d-ac48-4e5e6e5bce6b","resolution":{"observed_at":"2026-08-06T23:42:14.761772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:12.608375Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:12.608375Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:1f789a4d1a7d23dba9da602448892d8e0fe38505b64dd71c6994a19229eec793","observation_id":"82b5761f-a244-4e85-a8c3-af36bc21f00c","resolution":{"observed_at":"2026-08-06T23:42:12.608375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:12.745946Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:12.745946Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:d3335547665c6322cbf4c80ac77cd70d78d342f13e34e2382307c3b875e2d2ac","observation_id":"6c0cd4ff-faab-4b10-8712-113e8b02756c","resolution":{"observed_at":"2026-08-06T23:42:12.745946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-06T23:42:12.861061Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:12.861061Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:dcdafb7bdb7e0461cebd867eac938fd02455e26985548b87c9925e5a98d05c86","observation_id":"7381ecb4-c8b7-408c-aeab-a652d13bdaa3","resolution":{"observed_at":"2026-08-06T23:42:12.861061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:14.731470Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":"35ea1286-5823-49fb-9a30-a24adbb00710","year":2020},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:12.987283Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:3ad970ad6b233c51659d09f07163bfb3f5cc6c43b7805c7206d9d7a421cb2169","observation_id":"86ed57a2-71bd-40c1-853d-80c33517ed53","resolution":{"observed_at":"2026-08-06T23:42:14.735153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.104331Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.Science China Information Sciences, 67(12):220101, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.104331Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:58089ced4887f74ea76c42436154dfb88d2828ede4f690e6bcb72f8b8feba787","observation_id":"5bee69ee-7818-46a8-9df8-f73dd6b562f5","resolution":{"observed_at":"2026-08-06T23:42:13.104331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.115317Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.115317Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:06f9e19e362fcb0f7e9fd94ce042daf632cf56ca516d1bc85046658c478ae704","observation_id":"462315c5-df46-4cd5-902b-3e7e4a06829e","resolution":{"observed_at":"2026-08-06T23:42:13.115317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T23:42:13.221205Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms.arXiv preprint arXiv:2406.07476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.221205Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:0f9589d9cb847de5496620a16281254cccaa6f25398836ea0a0e02e56a118db7","observation_id":"df06f042-e510-4e5b-9b2e-e0738b1bc496","resolution":{"observed_at":"2026-08-06T23:42:13.221205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.312034Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.312034Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:99e57d86eb9d0eb9a30f437c72ad6f5d6034d16922fd8341f55689c5602f69cf","observation_id":"79fbf471-1e39-4852-ba00-21bc3a6d6044","resolution":{"observed_at":"2026-08-06T23:42:13.312034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-06T23:42:13.454102Z","title":"Mobilevlm v2: Faster and stronger baseline for vision language model.arXiv preprint arXiv:2402.03766, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.454102Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:dd70723b2d3da71263809bed33da1e4c81c61de60adff4fa2989743c7cd9ae3a","observation_id":"0d6832b0-410d-4b1f-92d6-4cc10e3b1c2e","resolution":{"observed_at":"2026-08-06T23:42:13.454102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-06T23:42:13.573381Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.573381Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:543fed65469bc93807d8225ace05c2724be3f7933ea1422098020ccde81eb787","observation_id":"449027db-9c5c-4f6d-8032-641bcdf7cb38","resolution":{"observed_at":"2026-08-06T23:42:13.573381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T23:42:13.643721Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.643721Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:2139caa2d229d67cd08804825d12e32d3aadc36f60c9e21d47a74192cd053c58","observation_id":"13947f52-783b-454a-91fa-8130a6778368","resolution":{"observed_at":"2026-08-06T23:42:13.643721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.647604Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.647604Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:29d7c1f6624ec44d8f110e46560659969b73fef084d7a9f791540d7ab12a5433","observation_id":"1b2efe2f-aa52-4eb1-9131-c6e27d88536d","resolution":{"observed_at":"2026-08-06T23:42:13.647604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.651057Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high- resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.651057Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:b6ca1859bda9eaf3a38d8bca02c2ed246f0b990731c5972b1abd832dc209a43a","observation_id":"95f8fe7e-d105-4ad8-81f1-b0a2a69cf37a","resolution":{"observed_at":"2026-08-06T23:42:13.651057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.659269Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.659269Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:de648525564acc9eba323aa0505df372e35009c25ea01144b939cd7aa85e869c","observation_id":"7e0b6d1c-7c87-40ec-9329-9ffcb2d1820f","resolution":{"observed_at":"2026-08-06T23:42:13.659269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T23:42:13.664483Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.664483Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:607340ebe2709b8cee8aaa476df03e8f24cccc7a0efeb97350e212ba5b6456fe","observation_id":"78709f2e-cfab-4f01-bf8a-e7c4225d944f","resolution":{"observed_at":"2026-08-06T23:42:13.664483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.668729Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.668729Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:2a2a46fc9de626acec9cdccbf7adfed3038d99c5f11f679550c42b0872bfcd83","observation_id":"48cc5443-fa87-494f-b4f2-7827e6dc9681","resolution":{"observed_at":"2026-08-06T23:42:13.668729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:14.672831Z","title":"Revisiting visual question answering baselines","venue":null,"work_id":"12bb3ec4-a75f-421b-b534-7c92bdec8f98","year":2016},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.673567Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:2de6fb99557615f0d3e700bea8b122c6e249fc59ca076c5d54a380c4877df7b2","observation_id":"ae2c4f91-7e96-4078-b5a6-3d1d269e129a","resolution":{"observed_at":"2026-08-06T23:42:14.677213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T23:42:13.682523Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.682523Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:823db28d69acf7888310ee3622ded850d837246d67a0d7bb46e1bc7413b670bb","observation_id":"12d634bf-4016-487f-8859-b9e3e94c7490","resolution":{"observed_at":"2026-08-06T23:42:13.682523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.686298Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.686298Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:3756862b6b63b13b2f5bb1aaef17518876d1e5af62efc86c29ea21041ec8e1dc","observation_id":"ce93ee01-fe91-472f-bcf2-f0a7db191003","resolution":{"observed_at":"2026-08-06T23:42:13.686298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.691664Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.691664Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:d506ced5f691dc9865ab57a87111dc2339fe54bdeeb826e5cc709bd3ee1ba5d8","observation_id":"723cb2b3-701b-41ba-b3d1-7188ab3ff7da","resolution":{"observed_at":"2026-08-06T23:42:13.691664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.704172Z","title":"Blip: Bootstrapping language- image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.704172Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:509419072720a79bf0ba210480d075fcbc63a6822b20e11ed2754e5cb2095ce4","observation_id":"30b5d714-c6a1-48e9-9f0c-1694aef87db8","resolution":{"observed_at":"2026-08-06T23:42:13.704172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.707741Z","title":"Align before fuse: Vision and language representation learning with momentum distillation.Advances in neural information processing systems, 34:9694–9705, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.707741Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:6de5c88f361d26c887ec8fffb247c970ca4d5298e9fb5df366cf7c1ec882913b","observation_id":"d4b2980e-3966-49a0-8db7-1f6893e8df60","resolution":{"observed_at":"2026-08-06T23:42:13.707741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:14.608418Z","title":"Videochat: Chat-centric video understanding, 2023","venue":null,"work_id":"77622ef5-04a7-4763-acf9-e47a12e05f24","year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.711251Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:a2f0512a9bc5a7dcd2c296c654fecd084ea00c4795d98a75ce92e0c216350fa3","observation_id":"97785b96-6907-414c-b42a-18ef2769ef47","resolution":{"observed_at":"2026-08-06T23:42:14.611889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.717277Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.717277Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:08bdbf1842d4543d91fbd2f94723f0c7b02f18ce7086d551ca5050125b2f502c","observation_id":"e2db0624-1235-4266-9b1c-cdaaacf9840a","resolution":{"observed_at":"2026-08-06T23:42:13.717277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.725584Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.725584Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:e79bf8109f3cf48c040f5b19c7e75ed195050f39435308e05ef58189051422f0","observation_id":"b47862b3-ec9f-4319-b291-e06a96870b66","resolution":{"observed_at":"2026-08-06T23:42:13.725584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-06T23:42:13.730319Z","title":"Evaluating object hallucination in large vision-language models.arXiv preprint arXiv:2305.10355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.730319Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:bbecafd2e1288bf4331882edf791f402781ad907f6d7b08e05e9a03ea1fb28d6","observation_id":"8622997f-673b-4e3f-a8c5-87bf0c700d2f","resolution":{"observed_at":"2026-08-06T23:42:13.730319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-06T23:42:13.735467Z","title":"Moe-llava: Mixture of experts for large vision-language models.arXiv preprint arXiv:2401.15947, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.735467Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:01c3b3b743596be2a7500444f7971ee1f7d17dbc6b8d5f75e931c487932c91cd","observation_id":"a231d075-a609-4905-b05a-9bab02935191","resolution":{"observed_at":"2026-08-06T23:42:13.735467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T23:42:13.740088Z","title":"Video-llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.740088Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:d6937fe0517367d4cd14834648fc098546e3c3fad5b25e4eb93f064ee218ece2","observation_id":"5b8cf93e-0509-4b35-8c94-f8154c1d8458","resolution":{"observed_at":"2026-08-06T23:42:13.740088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05935","last_updated":"2025-03-21T10:19:01Z","snapshot_observed_at":"2026-08-06T11:32:00.537531Z","submitted_at":"2024-02-08T18:59:48Z","title":"SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05935","snapshot_observed_at":"2026-08-06T23:42:13.746024Z","title":"Sphinx-x: Scaling data and parameters for a family of multi-modal large language models.arXiv preprint arXiv:2402.05935, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.746024Z"},"links":{"cited_paper":"/paper/2402.05935","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:a443484df8250589748aa87b9e3095a64d8cf5a17be75a3a4924d0f2f642ad8b","observation_id":"ce0f5d7b-3421-45af-b0a9-5c6c2810d65c","resolution":{"observed_at":"2026-08-06T23:42:13.746024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.754518Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.754518Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:868f72d4cc2afeeca4a6f580fc4bde3acf8f8490ba25cae0d3640d8a76115093","observation_id":"019916fc-4086-4e9e-ba18-06309506835d","resolution":{"observed_at":"2026-08-06T23:42:13.754518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.759294Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.759294Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:aa04b5200616ee12d476568994161d4ba25e9654cfd4d6c9cceff4d5f5183220","observation_id":"403461a0-177e-4689-a44c-3525b9891f31","resolution":{"observed_at":"2026-08-06T23:42:13.759294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.762862Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.762862Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:68d6b9495bbc68b4fedf185d04dda1575d53b563d1138fe91db9ff92c8bcdf4d","observation_id":"297559bd-906f-46be-b760-ff7b5aa00b18","resolution":{"observed_at":"2026-08-06T23:42:13.762862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.770024Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.770024Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:9b538e52f2b6a37ce9bf4955fd4e4997807f58d5ad0696f7c14fa6bb114d144b","observation_id":"cdd77114-445b-4867-9373-2a5056bc7b38","resolution":{"observed_at":"2026-08-06T23:42:13.770024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-07-06T08:12:46.398794Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-06T23:42:13.773647Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks.arXiv preprint arXiv:1908.02265, 2019","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.773647Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:b475488ebee5b69585b107d2db4571f8b917aeec47302de09c5359f6729e6dd1","observation_id":"8519c36c-eef2-429e-aa49-9d5a12ae840e","resolution":{"observed_at":"2026-08-06T23:42:13.773647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.778621Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.778621Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:de200cd03cccad835db2f040548f1df125ec36965b7988c6bfa44e807186621c","observation_id":"67b001ae-295d-45cf-906a-cafeb2cb178e","resolution":{"observed_at":"2026-08-06T23:42:13.778621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08202","last_updated":"2025-03-13T06:09:17Z","snapshot_observed_at":"2026-07-06T19:31:23.072307Z","submitted_at":"2024-10-10T17:59:22Z","title":"Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08202","snapshot_observed_at":"2026-08-06T23:42:13.784958Z","title":"Mono-internvl: Pushing the boundaries of monolithic multimodal large language models with endogenous visual pre-training.arXiv preprint arXiv:2410.08202, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.784958Z"},"links":{"cited_paper":"/paper/2410.08202","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:06daac64a8c740d9c2c1ebb852f4fb0f3136cd21b0af8994b2150557c2ab1799","observation_id":"a59232dd-a6e0-4986-affb-a787d45ad1d7","resolution":{"observed_at":"2026-08-06T23:42:13.784958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T23:42:13.788990Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models.arXiv preprint arXiv:2306.05424, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.788990Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:767bfb9fecbe8af11f1f0a3f614d0a9aff0f017985324b45b1734aa780e46184","observation_id":"c7bf4ee0-a720-4031-a320-aec3d66ec9fa","resolution":{"observed_at":"2026-08-06T23:42:13.788990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.793581Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding.Advances in Neural Information Processing Systems, 36:46212–46244, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.793581Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:d7920ce9134da63d28c6912ed6d6db522b6d328f85a513708f6e12604580ebdc","observation_id":"af78bd7e-562d-4997-bc73-5b3ee4c2cb8d","resolution":{"observed_at":"2026-08-06T23:42:13.793581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.798585Z","title":"Llama 3.2: Revolutionizing edge ai and vision with open, customizable models.Meta AI Blog","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.798585Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:76fd463f74e068d63178ba3fd1e7dba8d0504ca54fa036ac8830b6ca5fc6ca40","observation_id":"a4a41ed7-6599-47f3-bd10-b788e8688ad2","resolution":{"observed_at":"2026-08-06T23:42:13.798585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.801951Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.801951Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:7ca8f22c921d20ff4367b8c36e7c48fe7887689c7b9d01cb35979cbbee05c6db","observation_id":"e6d8f519-7a59-4d74-9593-14d47ac90e97","resolution":{"observed_at":"2026-08-06T23:42:13.801951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:14.521274Z","title":"Language models are unsupervised multitask learners.OpenAI blog, 2019","venue":null,"work_id":"042d680a-084f-4c97-8f12-91b2c30a00d4","year":2019},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.809976Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:6937a1632b0d0d323ef733ae93e2153efc9c0ff6601ded0625d8147d17dcef26","observation_id":"0fdf2af3-937f-4bc1-ac7c-302b208475d2","resolution":{"observed_at":"2026-08-06T23:42:14.525704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.05941","last_updated":"2017-10-27T17:45:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-10-16T18:05:45Z","title":"Searching for Activation Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.05941","snapshot_observed_at":"2026-08-06T23:42:13.819653Z","title":"Searching for activation functions.arXiv preprint arXiv:1710.05941, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.819653Z"},"links":{"cited_paper":"/paper/1710.05941","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:6169ed42ffff15a98127dd3996819d87f149c2b3223bfff8a2b51ae362cbbbdd","observation_id":"82f9ab2e-4bd1-4a08-917c-5cecb7d27d47","resolution":{"observed_at":"2026-08-06T23:42:13.819653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08813","last_updated":"2024-10-21T03:08:08Z","snapshot_observed_at":"2026-08-07T17:42:30.374808Z","submitted_at":"2024-05-14T17:59:02Z","title":"CinePile: A Long Video Question Answering Dataset and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08813","snapshot_observed_at":"2026-08-06T23:42:13.831606Z","title":"Cinepile: A long video question answering dataset and benchmark.arXiv preprint arXiv:2405.08813, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.831606Z"},"links":{"cited_paper":"/paper/2405.08813","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:235af35272423f52b40a3c8e5ec893cb74a14a9d3966fc8c2f42f2c548a92c36","observation_id":"b7754035-5226-457d-a5d6-8fd86eda5e15","resolution":{"observed_at":"2026-08-06T23:42:13.831606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.836198Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.836198Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:55d7d8ff1d5fd1e9d017acfa4ca6a0dfc786615b9ec295d32742dd9031bd4ba3","observation_id":"18327225-f708-490a-a6ed-ddbf008e6d03","resolution":{"observed_at":"2026-08-06T23:42:13.836198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:14.500708Z","title":"Flops profiler, 2025","venue":null,"work_id":"635d7efc-1b63-4d1c-83dc-94d3155ba146","year":2025},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.843580Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:dcc6c74b1ae7cb99352bc24a6b2faa75cb8071906f60fa7ea764556e4a2e23dc","observation_id":"63618e8b-195e-4ee8-969e-b82cdfb805f5","resolution":{"observed_at":"2026-08-06T23:42:14.505878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T23:42:13.848825Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.848825Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:701656f7a3f7b4fd069c294baa7b69daf6b13d28b940b63f0b6bad3e4ab3e9ca","observation_id":"578a6673-3b6e-455d-8f3a-493a78cf7456","resolution":{"observed_at":"2026-08-06T23:42:13.848825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.852755Z","title":"Mlp- mixer: An all-mlp architecture for vision.Advances in neural information processing systems, 34:24261–24272, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.852755Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:43cd85eb7ee3a7697700f0ed9c6e16978f1cef9c023bf19eb378bbd2fb32dad2","observation_id":"bb38303f-ae63-4e72-844c-9059286c1dbc","resolution":{"observed_at":"2026-08-06T23:42:13.852755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-06T23:42:13.863089Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms.arXiv preprint arXiv:2406.16860, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.863089Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:b032a2d4081f02c65cd49427337606279d9457cf5241592b033fa0ed3e0a2b42","observation_id":"ab8e50e7-81d8-4492-a41f-7c3711c74420","resolution":{"observed_at":"2026-08-06T23:42:13.863089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T23:42:13.878802Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.878802Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:3bd170bd10df7491b2513fad8474b30501b0a142a80b1e51d2b9c7707ff722e2","observation_id":"2debb5ab-3107-4b9d-bc1a-d9f60141ed15","resolution":{"observed_at":"2026-08-06T23:42:13.878802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.09792","last_updated":"2022-01-24T16:42:56Z","snapshot_observed_at":"2026-08-04T20:01:19.376192Z","submitted_at":"2022-01-24T16:42:56Z","title":"Patches Are All You Need?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.09792","snapshot_observed_at":"2026-08-06T23:42:13.886946Z","title":"Patches are all you need?arXiv preprint arXiv:2201.09792, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.886946Z"},"links":{"cited_paper":"/paper/2201.09792","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:0858557ceb240aca13e9a96c12b3fbaf6cb69c1ec483dc241c6eedbbf5995689","observation_id":"e808306e-e95a-40df-a2bf-51795d5012aa","resolution":{"observed_at":"2026-08-06T23:42:13.886946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.890551Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.890551Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:cc23819899758bf9fb992b953b83c7ac0516e7efd1df15330c66138e90ea2a57","observation_id":"a476ad82-1e46-458e-a4f5-f3e88a671a9e","resolution":{"observed_at":"2026-08-06T23:42:13.890551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18139","last_updated":"2024-06-26T07:44:24Z","snapshot_observed_at":"2026-08-04T06:27:25.663339Z","submitted_at":"2024-06-26T07:44:24Z","title":"LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18139","snapshot_observed_at":"2026-08-06T23:42:13.894002Z","title":"Look-m: Look-once optimization in kv cache for efficient multimodal long-context inference.arXiv preprint arXiv:2406.18139, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.894002Z"},"links":{"cited_paper":"/paper/2406.18139","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:08d19587501f3d0f6e1cae3ef85f0b25f7e5d290f9acf1f631041e948c75d291","observation_id":"fdea2b54-0b7f-49e1-965a-c3998b9c5e04","resolution":{"observed_at":"2026-08-06T23:42:13.894002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:14.472492Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":"1186b4c8-887d-4aa9-8e37-aa51cf8c5b58","year":2025},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.903098Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:dee55d33ab2d793eed0115faa1bc6f5fab774ed0f48257878a344713f7a3b0be","observation_id":"556e51c2-2ca4-4449-9009-2ac112aa07e0","resolution":{"observed_at":"2026-08-06T23:42:14.475667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T23:42:13.912263Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.912263Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:4e1d87d3d0c33b1a9c8fb281e72bb36df77d36849b9b71a380dba1bc48c44305","observation_id":"4716d017-f258-4481-801d-4b9bdde49b55","resolution":{"observed_at":"2026-08-06T23:42:13.912263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:14.458779Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models","venue":null,"work_id":"bea911e1-276f-4af2-8e35-9967ee32ac55","year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.916176Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:8ff8cac85d86150da1c5eb70e7b4030865f5d513ecc2ff4665a79b20c7d8834b","observation_id":"90372d15-99a1-4b77-8d32-c05862fa7573","resolution":{"observed_at":"2026-08-06T23:42:14.464007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:14.447737Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"b3328630-d77c-42c0-b6e3-cb34a9f46703","year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.920019Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:fff64a38a972ee79b9a2db040073d6df02ff8fe630682881200cf7585285e88e","observation_id":"1843186c-721c-4ef5-9ade-c338527de335","resolution":{"observed_at":"2026-08-06T23:42:14.451218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-06T23:42:13.923332Z","title":"Coca: Contrastive captioners are image-text foundation models.arXiv preprint arXiv:2205.01917, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.923332Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:0b3ae6a185f3eec2d909fb352f9c091cad49e09a8b042772c4c7b074b00fe598","observation_id":"9467c2b3-921c-48c6-a38b-87433cedbbc4","resolution":{"observed_at":"2026-08-06T23:42:13.923332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.930971Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.930971Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:75cb0218d065c023bdfdac7a987de4dfca95ba698133e21bc8c9c36842ca703b","observation_id":"d2685d41-a199-451c-b56c-5dd04ca1235d","resolution":{"observed_at":"2026-08-06T23:42:13.930971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:13.947456Z","title":"Root mean square layer normalization.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.947456Z"},"links":{"citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:4b3db092baf01651268cba127c1df5061cd9a8b85326c4ec9c8726458d986d42","observation_id":"601d00e5-a49a-4575-8f25-1aa2ee7a768e","resolution":{"observed_at":"2026-08-06T23:42:13.947456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T23:42:13.955406Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding.arXiv preprint arXiv:2306.02858, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.955406Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:e96720088535da9bb834f8e420190a9e5c67f783c58c49f02ff4a17598c1e14d","observation_id":"de1d6570-519c-4776-876d-ecf848bd4c48","resolution":{"observed_at":"2026-08-06T23:42:13.955406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-06T23:42:13.967404Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models.arXiv preprint arXiv:2407.12772, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.967404Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:09401132a878ddcc6ab86b78e01248a1d406cab128931ca78b5d96c38e800ed2","observation_id":"ed01f621-792c-4699-afb1-f54e0c1f7f6d","resolution":{"observed_at":"2026-08-06T23:42:13.967404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T23:42:13.971332Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.971332Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:a21941c10843fbca6036a29b2707c1dc0d334eacfdb45daa0b0770d52cdf74f5","observation_id":"35bc73c8-054a-4132-919a-d3a9d7e7a3e6","resolution":{"observed_at":"2026-08-06T23:42:13.971332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03496","last_updated":"2024-06-05T17:59:40Z","snapshot_observed_at":"2026-07-06T18:26:05.938067Z","submitted_at":"2024-06-05T17:59:40Z","title":"Wings: Learning Multimodal LLMs without Text-only Forgetting","version":1},"cited_work":{"arxiv_id":"2406.03496","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03496","snapshot_observed_at":"2026-08-06T23:42:14.036479Z","title":"Wings: Learning Multimodal LLMs without Text-only Forgetting","venue":"cs.CL","work_id":"612bc2a1-4db9-4dff-bc95-b44a54478c73","year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.975077Z"},"links":{"cited_paper":"/paper/2406.03496","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:bf64ba9e28de89fab1c4dd70cd0b8382f34235848f0b59a3a42a797eeb6ae065","observation_id":"149c2511-5fae-4c5e-9958-47f2b52cd5fb","resolution":{"observed_at":"2026-08-06T23:42:14.042993Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-06T23:42:13.979447Z","title":"U n e x p e c t e d # visual tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.979447Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:562a06d385897e1851307c997dcca4df54d07657fa39a6db52378a80e3fef6d2","observation_id":"7abdeaac-5cb1-4a79-9983-d83daf5b6c7d","resolution":{"observed_at":"2026-08-06T23:42:13.979447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:34:50.091534Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":1,"verified_fuzzy":9},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 2 inbound Pith citation observations for arXiv:2506.16691."}