{"as_of":"2026-08-14T06:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e5923429b180376c3b39c871b21c766cb663cb73aa8be3d57443c5955f887ee7","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:37:54.891321Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.12787/citation-record","integrity":"/paper/2411.12787/integrity","json":"/paper/2411.12787/citation-record.json","paper":"/paper/2411.12787"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:54.675226Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.675226Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:904a13b0b93b2b39456d4e09eecb4447ed9b0ab40bc698d99f0db767d18eda69","observation_id":"d7f1bee5-c5be-4905-b8ca-a43edb0dd259","resolution":{"observed_at":"2026-08-12T17:37:54.675226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-14T05:15:12.190552Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-12T17:37:54.681289Z","title":"Layer normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.681289Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:d546617f33d60d364913014cd5c2d5c31da905f881991aa7820438a95d83a09a","observation_id":"a26616b5-c94c-419a-a46a-4fef259519f5","resolution":{"observed_at":"2026-08-12T17:37:54.681289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T17:37:54.687801Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.687801Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:2ef8a88591245df003e81d1ab81b6be08fd4cf1f96e9f944d3b35f3fe460d7f3","observation_id":"2b986d2a-0096-41de-86b8-ffc475aaa73e","resolution":{"observed_at":"2026-08-12T17:37:54.687801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-12T17:37:54.695363Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.695363Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:0d32d532a5d5f411cd4616126145e910b051f0c248e5c5ec8bea878937d142c7","observation_id":"5afec7ec-c18a-4f90-ae8a-94c76f4ef2bc","resolution":{"observed_at":"2026-08-12T17:37:54.695363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16160","last_updated":"2024-01-30T15:44:58Z","snapshot_observed_at":"2026-08-13T04:32:42.021920Z","submitted_at":"2024-01-29T13:48:36Z","title":"LLaVA-MoLE: Sparse Mixture of LoRA Experts for Mitigating Data Conflicts in Instruction Finetuning MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16160","snapshot_observed_at":"2026-08-12T17:37:54.701624Z","title":"Llava-mole: Sparse mixture of lora experts for mitigating data con- flicts in instruction finetuning mllms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.701624Z"},"links":{"cited_paper":"/paper/2401.16160","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:78814d002211a08dc842dd76ef72e4a65bcd7571e500368865c4125fdc2e586d","observation_id":"66132ade-bf2d-4a37-b9ba-22066cb3ef22","resolution":{"observed_at":"2026-08-12T17:37:54.701624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:54.709703Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.709703Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:8f3b33b9d467754c8f446f306c8ae7d0506f616b267a0dc87c389e519c504ace","observation_id":"2f5db9c4-0d15-41d3-9a10-32912c279eef","resolution":{"observed_at":"2026-08-12T17:37:54.709703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:54.715260Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.715260Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:13fce737efa37c5caee429aeb42e1bd6dc942305d8417c6d75c286aa48e26023","observation_id":"08921ef2-c25c-45a5-97d2-dde53a6983fd","resolution":{"observed_at":"2026-08-12T17:37:54.715260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:54.720473Z","title":"Parameter-efficient fine-tuning of large-scale pre-trained language models.Nature Machine In- telligence, 5(3):220–235, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.720473Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:a73a06f184dca7b977f4adb7bb13040fffd5ce7865198d1fd7a5458809dc2109","observation_id":"0da724d6-0a78-47c3-bf3b-d571344a3133","resolution":{"observed_at":"2026-08-12T17:37:54.720473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17221","last_updated":"2024-01-30T18:09:11Z","snapshot_observed_at":"2026-08-13T06:57:05.095859Z","submitted_at":"2024-01-30T18:09:11Z","title":"MouSi: Poly-Visual-Expert Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17221","snapshot_observed_at":"2026-08-12T17:37:54.726053Z","title":"Mousi: Poly-visual-expert vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.726053Z"},"links":{"cited_paper":"/paper/2401.17221","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:890956bb225a2cc024613c177ba017d0204427cfc1faf380d636abe510b8a345","observation_id":"a6e169af-b8f8-4e5e-bdd5-e05a896e9cc3","resolution":{"observed_at":"2026-08-12T17:37:54.726053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:55.712632Z","title":"Deep sparse rectifier neural networks","venue":null,"work_id":"1c1b19d4-83b0-41d6-82d2-21377de57228","year":2011},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.732437Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:2da487cf8efbf5672b0857af10a2b10182c7d1ca1db362c108e7bead804c171b","observation_id":"791b1a21-74a6-4ede-ba5f-e9c4af2a9656","resolution":{"observed_at":"2026-08-12T17:37:55.718337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T17:37:54.738181Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.738181Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:517735cba64562b3f6737c67b3ee67771767d728e48ede209fb075005aad2744","observation_id":"95eb8dfe-3c88-4319-944f-85912b3452dd","resolution":{"observed_at":"2026-08-12T17:37:54.738181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:54.743855Z","title":"Harder tasks need more experts: Dynamic routing in moe models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.743855Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:37d4378c60ee44a1bd186c4d581464a8f4ff8575e4d7c5a0d93c2326b1bc6463","observation_id":"acacf141-d1a7-492d-b5b9-3c6f8cf9c8e3","resolution":{"observed_at":"2026-08-12T17:37:54.743855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12730","last_updated":"2024-12-16T06:16:27Z","snapshot_observed_at":"2026-08-12T23:20:10.605603Z","submitted_at":"2024-07-17T16:49:34Z","title":"RoDE: Linear Rectified Mixture of Diverse Experts for Food Large Multi-Modal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12730","snapshot_observed_at":"2026-08-12T17:37:54.748872Z","title":"Rode: Linear rectified mixture of diverse experts for food large multi-modal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.748872Z"},"links":{"cited_paper":"/paper/2407.12730","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:3b56ecb148d57e8f8ee56e741685b186ef4baa900f17cced9877b1fadf2040a1","observation_id":"0f0c4c9c-b5a1-4e67-961f-33c073ec933b","resolution":{"observed_at":"2026-08-12T17:37:54.748872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:55.693635Z","title":"Unlocking textual and visual wisdom: Open-vocabulary 3d object detection enhanced by comprehensive guidance from text and image","venue":null,"work_id":"af4f51d3-06e5-4d11-befb-ef96e8360044","year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.754030Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:49fad45a6b49f61e529662f9f33599200371c754df050ecbd255fd31535c3d85","observation_id":"2cae4764-886c-4fa6-92aa-ae68254158f4","resolution":{"observed_at":"2026-08-12T17:37:55.699366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09456","last_updated":"2025-04-13T06:47:32Z","snapshot_observed_at":"2026-08-14T03:59:51.221688Z","submitted_at":"2025-04-13T06:47:32Z","title":"Don't Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09456","snapshot_observed_at":"2026-08-12T17:37:54.759113Z","title":"Don’t deceive me: Mitigating gaslight- ing through attention reallocation in lmms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.759113Z"},"links":{"cited_paper":"/paper/2504.09456","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:e304b6653989321aa16bcba71b0c05e3d66032455a8e1b9eb7fb692b570fcb31","observation_id":"7ad139bc-c6db-4689-ac7b-37cdb056f429","resolution":{"observed_at":"2026-08-12T17:37:54.759113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:55.676863Z","title":"Lumen: Unleashing versa- tile vision-centric capabilities of large multimodal models","venue":null,"work_id":"f1ead88d-b6cf-49b3-b790-de966f0673a6","year":2025},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.764630Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:2e199995e8c6b0071bc6653ea88b6333d44c64ff65bbf942afdab0525497ab6a","observation_id":"8e8fdd22-c8c3-4c82-b9b2-96d3439bc3a4","resolution":{"observed_at":"2026-08-12T17:37:55.682222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:54.770220Z","title":"Imagenet classification with deep convolutional neural net- works","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.770220Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:5f5f7bb34b37eb1bd1ee6fbc42edd7cb501a842e89e135dda289b5e7717abb3d","observation_id":"7da838a1-9d43-4d58-99a5-22b63f4f3261","resolution":{"observed_at":"2026-08-12T17:37:54.770220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:54.775267Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.775267Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:1ba4a157d4cd0919cfb676a6687b96c193eecf7369cd6f857aee20e41c14d111","observation_id":"c7b873ba-d7bf-4ae4-b205-0edc508b4c29","resolution":{"observed_at":"2026-08-12T17:37:54.775267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:54.780768Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.780768Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:1e933a8fe843934c5a8dca2e369f2bca5ddb75e69c72b2056d00d1d60cbea77c","observation_id":"eccca891-7eb6-4474-bd9e-d6cc548c56e1","resolution":{"observed_at":"2026-08-12T17:37:54.780768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:55.620393Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"be0fa673-9668-4a20-9364-5ed617f9fd3a","year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.786295Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:4d9cd2b299454d886cb145191a2ddfc123af07d54e351512e9affc365f1566ba","observation_id":"95104aa3-f445-495f-93da-ecc27bb27c04","resolution":{"observed_at":"2026-08-12T17:37:55.625708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:55.599932Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"778ca0b1-4e56-4522-aa8c-fc7e3b2b23da","year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.792350Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:ecdf5a359b0c1837352116de36a1527ef5ebe019814349145df4e6677ec626d8","observation_id":"480ba212-1816-4dbd-9758-2dd3d696f467","resolution":{"observed_at":"2026-08-12T17:37:55.606297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-12T17:37:54.798888Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.798888Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:ca62de34e98a325dc629f5c04768d0ebda024361ef48cfb53c4c8856bc945276","observation_id":"9823dec1-cb94-42d7-a37d-f41e97f3ed15","resolution":{"observed_at":"2026-08-12T17:37:54.798888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00361","last_updated":"2024-08-10T05:26:24Z","snapshot_observed_at":"2026-08-13T00:17:49.849948Z","submitted_at":"2024-05-01T07:33:43Z","title":"AdaMoLE: Fine-Tuning Large Language Models with Adaptive Mixture of Low-Rank Adaptation Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00361","snapshot_observed_at":"2026-08-12T17:37:54.805675Z","title":"Adamole: Fine-tuning large lan- guage models with adaptive mixture of low-rank adaptation experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.805675Z"},"links":{"cited_paper":"/paper/2405.00361","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:ef7b8e07bb6ce84121bab762491e7dce8364b0ddb82bd6389a1d0cc063e9962c","observation_id":"0f5cf207-ebb8-4ff4-a6c4-54c25a6b83e6","resolution":{"observed_at":"2026-08-12T17:37:54.805675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-12T17:37:54.811609Z","title":"Deepseek-vl: towards real-world vision- language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.811609Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:01565feafaaaf781a1b444ce77da8f22e0e2f8b01b41016ae04e19940787e243","observation_id":"2bf07059-d448-4a95-9510-58703b1ff33f","resolution":{"observed_at":"2026-08-12T17:37:54.811609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-12T17:37:54.817637Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.817637Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:6237fac25083724b4be91522930ac59e0b2916da604d833f6207d89e18b738df","observation_id":"d93f0c8e-19ec-4a4a-b20d-2101feb765f4","resolution":{"observed_at":"2026-08-12T17:37:54.817637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:55.581988Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":"4d227ce4-1e2d-4873-8649-9244b0d7848d","year":2015},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.823531Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:194593c636ccae3503202421f8efd087923b37cc0c964260156cdb3a6b29d96b","observation_id":"16286e8f-2876-4b89-9ad0-6c6ad8ab5879","resolution":{"observed_at":"2026-08-12T17:37:55.587874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.08771","last_updated":"2018-09-12T14:13:33Z","snapshot_observed_at":"2026-08-10T08:51:09.033778Z","submitted_at":"2018-04-23T22:54:55Z","title":"A Call for Clarity in Reporting BLEU Scores","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.08771","snapshot_observed_at":"2026-08-12T17:37:54.828772Z","title":"A call for clarity in reporting bleu scores","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.828772Z"},"links":{"cited_paper":"/paper/1804.08771","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:781bc5600411a28cd193248baddd473497fffa6deed382faadd194fef0826a65","observation_id":"4167a38d-3880-40f4-a5ef-164b61f5a131","resolution":{"observed_at":"2026-08-12T17:37:54.828772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:55.565042Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"0e5ff243-a476-4d34-b585-213f4bb0d8d8","year":2021},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.834854Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:55fad9f9540c25d29e9755cf30631e5418ac78763b5863547456f3a4968ffdbe","observation_id":"61538d55-5b18-46f5-b59e-c707a540807b","resolution":{"observed_at":"2026-08-12T17:37:55.570322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:55.539262Z","title":"Scienceqa: A novel resource for question answering on scholarly articles","venue":null,"work_id":"feb41bdc-0970-4395-923f-ced7d7649d20","year":2022},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.840309Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:9a0cc200270da598de26ecd65af85356ba918c483176fda2b6e5b6537e787f11","observation_id":"780a05aa-8369-4659-8f5a-6edb99520912","resolution":{"observed_at":"2026-08-12T17:37:55.547356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-12T17:37:54.845427Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.845427Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:f0c1b91d073c0af9c7180d2568ca3aa2164397976e0d957b91ecfcb4f06a55af","observation_id":"ecd51877-14f4-4d05-b97d-ea703d8943f3","resolution":{"observed_at":"2026-08-12T17:37:54.845427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:54.850908Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.850908Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:32cfaabf7f80facb33620e3467003bc773456fbc4963fc5a8b8c759b21a02183","observation_id":"031c52a2-023b-4533-841e-c6bbe7f3c87c","resolution":{"observed_at":"2026-08-12T17:37:54.850908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T17:37:54.855723Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.855723Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:5868295873bab6dc4fb3a980fc5e4ffa49757eaef4766b3bd2f9bcbce63c6cdc","observation_id":"264b8c67-1619-472e-9c4c-6c98e158f314","resolution":{"observed_at":"2026-08-12T17:37:54.855723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13628","last_updated":"2024-04-21T11:59:53Z","snapshot_observed_at":"2026-08-13T00:25:17.233474Z","submitted_at":"2024-04-21T11:59:53Z","title":"Mixture of LoRA Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13628","snapshot_observed_at":"2026-08-12T17:37:54.861350Z","title":"Mixture of lora experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.861350Z"},"links":{"cited_paper":"/paper/2404.13628","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:fc20fbd7b3c49d03214d0f8c9f75c80f257e6b1eb86227bfe7cb9d05dcd904c0","observation_id":"1a8cebf6-8ead-4290-9bfd-00fc64a31cf5","resolution":{"observed_at":"2026-08-12T17:37:54.861350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:37:55.503803Z","title":"Vision transformer with deformable attention","venue":null,"work_id":"f7a7ada6-21d5-4e8a-85f6-04ce8c048496","year":2022},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.867653Z"},"links":{"citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:c9300c7ce42ea6dd9c3218db16363f9ec629935ed628950635f3fa5bcc7ecd2e","observation_id":"9663fe63-948c-4bfd-9f35-dc7e1365bfa1","resolution":{"observed_at":"2026-08-12T17:37:55.511682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-13T00:51:59.402203Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-12T17:37:54.873349Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.873349Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:c1af9b2f81c51cf72ffbbed8d0c4b59914330e0f3c8052a2b55d49e7dfd9d1b5","observation_id":"6aee29cb-5595-4836-be2c-d468dbc7c14c","resolution":{"observed_at":"2026-08-12T17:37:54.873349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14991","last_updated":"2024-04-12T14:21:20Z","snapshot_observed_at":"2026-08-13T04:55:22.304306Z","submitted_at":"2023-12-22T11:56:22Z","title":"FoodLMM: A Versatile Food Assistant using Large Multi-modal Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14991","snapshot_observed_at":"2026-08-12T17:37:54.879662Z","title":"Foodlmm: A versatile food assistant using large multi-modal model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.879662Z"},"links":{"cited_paper":"/paper/2312.14991","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:e1e3ea14645b11aed680672bccee4155122a97a282dbc485772b2faa9c5d16da","observation_id":"c651cc23-de9b-469f-b8a4-48eb6bd89114","resolution":{"observed_at":"2026-08-12T17:37:54.879662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T17:37:54.885564Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.885564Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:ce80e5e6f6776ba00a918ed992cacd82c28dc8fac92e02077bcce8d99b94d35a","observation_id":"bce9786f-9c3d-4cdd-8eeb-1345393caf8c","resolution":{"observed_at":"2026-08-12T17:37:54.885564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-08-13T17:54:01.724774Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-12T17:37:54.891321Z","title":"Deformable detr: Deformable trans- formers for end-to-end object detection","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.891321Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:3e6439270f1a19081c5bdd3043282c84b546aa4a1163be238409d086653fb426","observation_id":"b787204d-0eae-4bab-a0a2-258eadc739e8","resolution":{"observed_at":"2026-08-12T17:37:54.891321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T01:19:27.177255Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2411.12787."}