{"as_of":"2026-08-08T20:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c707938f698dbc2a4e1ecd6f78044bb24d43ebfa25046d75e0b3acd2b6cb7b51","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:21:21.500180Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.00260/citation-record","integrity":"/paper/2508.00260/integrity","json":"/paper/2508.00260/citation-record.json","paper":"/paper/2508.00260"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T10:21:21.310768Z","title":"GPT-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.310768Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:02fdef488e87c9e6974c8a87072e7ae1f403eca897beb2a2fcfaffb8507663a3","observation_id":"a2cd95b2-bd47-4f87-863c-e5546ad593d3","resolution":{"observed_at":"2026-08-06T10:21:21.310768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:22.063497Z","title":"Expert gate: Lifelong learning with a network of experts","venue":null,"work_id":"5b7b4981-8608-41e9-bd1c-7b15ac93a21b","year":2017},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.315076Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:b63f390abe9e856d927c79944ef828aeaa9b5979c473ea297fc7534dab86732c","observation_id":"8c6088e5-da7c-4619-bf4c-78bc5c5ff8be","resolution":{"observed_at":"2026-08-06T10:21:22.067100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:22.054214Z","title":"Memory aware synapses: Learning what (not) to forget","venue":null,"work_id":"825a5d61-6a4a-4b09-89fc-eec44e252071","year":2018},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.318768Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:d3330df40fbb88e013eb5c8fcee2b0eea931e13b8db78fbd72a307e658e4e877","observation_id":"99ba7021-4be1-4c8b-ab97-3ef594dff23e","resolution":{"observed_at":"2026-08-06T10:21:22.057628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:22.044025Z","title":"Generative multi-modal models are good class incremental learners","venue":null,"work_id":"e8750f43-f85b-4158-9eca-c817aee27d51","year":2024},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.322689Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:dd4533af77d6f7941f0ca25e7a585c47ff983eaa813cda4f858c8d99f768839f","observation_id":"f62ad9ad-b7c2-4400-94b4-e6169e020360","resolution":{"observed_at":"2026-08-06T10:21:22.047700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:22.033964Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":"41bd7ce3-4372-4143-ac91-28c3130b75aa","year":2024},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.326048Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:98075cf13a83812dcab546ee950f806dfee42b9c03bbb67a3608801768ab4462","observation_id":"8e8e1114-3b47-4343-a4fc-008ddfec2dd0","resolution":{"observed_at":"2026-08-06T10:21:22.037476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:22.023916Z","title":"Riemannian walk for incremen- tal learning: Understanding forgetting and intransigence","venue":null,"work_id":"f8e6bbf0-5a2f-4fb4-890a-1d90fde60da6","year":2018},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.329716Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:c34018c2215ff6017a5a7d75f24d6c01a52ae8f9bce454845fda04e60a0ac840","observation_id":"570d82c6-cebe-42ef-a1e6-21476761a094","resolution":{"observed_at":"2026-08-06T10:21:22.027727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:22.014010Z","title":"CoIN: A benchmark of continual instruction tuning for multimodel large language models","venue":null,"work_id":"b4d5dd45-c661-467c-b4be-aa3d3398e523","year":2025},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.333291Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:2387c856a0975cbdc1e1a9c7da0192c9444e28332921a931d191ecbfbab5ede7","observation_id":"30788f19-cb92-480b-8fbd-a5ac6691d02f","resolution":{"observed_at":"2026-08-06T10:21:22.017546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:22.003910Z","title":"Lifelong language pretraining with distribution-specialized experts","venue":null,"work_id":"11042c59-abeb-4f44-b9d7-7c4bf63ed1db","year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.336761Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:fa52eb9af0a396b85b1836f6bba1de8d6a7245d84d789dbe6fe6827c33fe41c4","observation_id":"dd7b02c6-1581-4797-8a2c-1351ec226a56","resolution":{"observed_at":"2026-08-06T10:21:22.007441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.993997Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality, march 2023.URL https://lmsys","venue":null,"work_id":"d2fbee2d-2d08-42ec-a87a-67b3127a48b5","year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.340156Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:3afdcfd73d5889787ba423c1bb804c9b6215f3114e81b893d5ca5e0165d41d5e","observation_id":"81a25914-8eaa-4039-a0dc-17fafc13e101","resolution":{"observed_at":"2026-08-06T10:21:21.997478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.983439Z","title":"V ocabulary-free image classification.Advances in Neural Information Processing Systems, 36:30662–30680, 2023","venue":null,"work_id":"942ac048-1cf1-4d86-8579-eea21a3cf59a","year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.343385Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:33a339211f36ff9f3ae09f6761a7de491d01c08da4ba626fa2611c9ede80efc3","observation_id":"945b7b39-0945-4280-a61a-bdaa7a41fb4d","resolution":{"observed_at":"2026-08-06T10:21:21.987564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T10:21:21.347451Z","title":"Instructblip: To- wards general-purpose vision-language models with instruc- tion tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.347451Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:7a87ee6658079cb5586b91012cdf4a75c9fafb9c23cfce163991b10868e6f5ca","observation_id":"2ab47047-23b1-4284-bff6-c519341f81e7","resolution":{"observed_at":"2026-08-06T10:21:21.347451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.972111Z","title":"RATT: Recurrent attention to transient tasks for continual image captioning.Advances in Neural Information Processing Systems, 33:16736–16748,","venue":null,"work_id":"5303a112-9fa6-42a6-83d9-e60f4a565483","year":null},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.351302Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:79b787a947c31bd71e0f8c2ab1e403e59d7c479d5e6e96e633be1e9d4d8ff32b","observation_id":"06a9d7c0-b14e-4747-883b-cdd02f613800","resolution":{"observed_at":"2026-08-06T10:21:21.976443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.961459Z","title":"DyTox: Transformers for continual learning with dynamic token expansion","venue":null,"work_id":"d7f7f814-0850-4136-ab3c-a73e19b8088a","year":2022},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.355162Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:2e071e1548d8306986c5419914457ec4ffcd57e6c5968881262c88b31c0953eb","observation_id":"a6ea476f-f29f-493b-a247-ed1bf7a12bc6","resolution":{"observed_at":"2026-08-06T10:21:21.965024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.951051Z","title":"EV A: Exploring the limits of masked visual representa- tion learning at scale","venue":null,"work_id":"e5df3fc1-92f2-4de4-ba55-e6d1f9540a97","year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.359574Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:8b175f07572b06d0625cb419a8537b99a5a928888ab80ecb2f6b968ccb5498f2","observation_id":"45fca5ca-69f9-48be-8db1-23abe7e24f42","resolution":{"observed_at":"2026-08-06T10:21:21.954607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.941084Z","title":"Beyond prompt learning: Continual adapter for efficient rehearsal-free continual learning","venue":null,"work_id":"9bc84d6f-635e-4fc6-a22e-1171b2e55a18","year":2024},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.363466Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:71cddaab9d68058750f2acb1b91296c26b12f1b7a5e37bb59337cd65e2d934d9","observation_id":"b22df089-9ead-47e1-a943-6e6380b1d531","resolution":{"observed_at":"2026-08-06T10:21:21.944646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16206","last_updated":"2023-11-27T15:04:48Z","snapshot_observed_at":"2026-08-08T00:39:51.098827Z","submitted_at":"2023-11-27T15:04:48Z","title":"Continual Instruction Tuning for Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16206","snapshot_observed_at":"2026-08-06T10:21:21.366736Z","title":"Continual instruction tuning for large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.366736Z"},"links":{"cited_paper":"/paper/2311.16206","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:379b00db7e4513e237485149b84e904a5dc294258c0d19c3199ab038fe6953bb","observation_id":"02372aff-844f-4e71-8370-72ec0917cdeb","resolution":{"observed_at":"2026-08-06T10:21:21.366736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.930981Z","title":"The many faces of robust- ness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":"0ab6c7cd-555b-4f33-94fc-c1a3d4320aed","year":2021},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.370202Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:59fcadb7dfaca0bead5c1fec88c7d0f27675a7de3cc85266664dddb5a7a81064","observation_id":"0bee0757-8a2a-4ee7-a506-1be9dca4f475","resolution":{"observed_at":"2026-08-06T10:21:21.934456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.920774Z","title":"CLIPScore: A reference-free evaluation metric for image captioning","venue":null,"work_id":"a38b69b7-83c3-44d5-b700-cac4e4bad537","year":2021},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.373331Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:10aab9290bb4a5c22592d38f11c664bb8c9d7606e9dbef03f94dcfb76ed91fd1","observation_id":"b20eeacf-6977-4ed0-ad91-0c2f538a8ce3","resolution":{"observed_at":"2026-08-06T10:21:21.924153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T10:21:21.376708Z","title":"LoRA: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.376708Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:bb65d1c9d65c3f23628d68236d3c27b682effa88565efbd6bbf395c458886b9a","observation_id":"3bdd2268-3957-48f4-88f7-8181ab064744","resolution":{"observed_at":"2026-08-06T10:21:21.376708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.380456Z","title":"Adaptive mixtures of local experts.Neu- ral computation, 3(1):79–87, 1991","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.380456Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:43b4534577f943514e667676cf37f01821dca77c21f1035b961b480cf9ea0786","observation_id":"5326a5b6-36e1-4a81-92ee-3c77860b2220","resolution":{"observed_at":"2026-08-06T10:21:21.380456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.904809Z","title":"Vi- sual prompt tuning","venue":null,"work_id":"bed74e92-84ed-49d7-94e4-1defc9c98dbf","year":2022},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.384416Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:0818f0805b3e151bd5ea811a299468cc16450c1b624eeca4eee9b42134b79783","observation_id":"8a380d33-a13b-4e35-94f8-41dbb652a36c","resolution":{"observed_at":"2026-08-06T10:21:21.908229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.894323Z","title":"Helpful or harmful: Inter- task association in continual learning","venue":null,"work_id":"03e64c8f-cfb5-4c32-9e88-0cc6a8f6315a","year":2022},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.387520Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:8600f9cd056aeca7df7b94a2567e64e7984cd9947409c618971f979bf89e27a4","observation_id":"4046f619-d310-4c43-916e-7e154fa85702","resolution":{"observed_at":"2026-08-06T10:21:21.898082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.884600Z","title":"Growing a brain with sparsity-inducing genera- tion for continual learning","venue":null,"work_id":"0ce3fd53-3a63-4880-9282-df0d9b30ebdd","year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.391038Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:fef8149d2bb84671a7f52f4b9f081ea64554468d3cdfcf8b53aaca07a4bca79c","observation_id":"c2627989-9973-45ca-8420-7fcadd3372a3","resolution":{"observed_at":"2026-08-06T10:21:21.888147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.874143Z","title":"Deep visual-semantic align- ments for generating image descriptions","venue":null,"work_id":"71cfd0a6-c3a4-4df1-b207-9f9381bcb8b8","year":2015},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.394628Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:83bfb595ff3b127c20b8f8754a3fb697749fa9c21b18546de6748e46afab3e52","observation_id":"263528cf-4529-4fb3-92b3-b84b4b146685","resolution":{"observed_at":"2026-08-06T10:21:21.877582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.863452Z","title":"Overcoming catastrophic forgetting in neu- ral networks.Proceedings of the National Academy of Sci- ences of the United States of America, 114(13):3521–3526,","venue":null,"work_id":"89f0d6e7-d90e-4e67-bb61-246c7376f6fe","year":null},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.397882Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:adff93fcbaf64be757d164fcba78ceed476a1f6f13d27b16e1914afff2e58f0a","observation_id":"6ad4d4fa-f5d2-4bd1-a32d-e55d25b24242","resolution":{"observed_at":"2026-08-06T10:21:21.867258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09700","last_updated":"2019-11-04T20:37:33Z","snapshot_observed_at":"2026-07-06T08:31:12.309726Z","submitted_at":"2019-10-21T23:57:32Z","title":"Quantifying the Carbon Emissions of Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09700","snapshot_observed_at":"2026-08-06T10:21:21.401198Z","title":"Quantifying the carbon emissions of machine learning.arXiv preprint arXiv:1910.09700, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.401198Z"},"links":{"cited_paper":"/paper/1910.09700","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:7f53a0da55496038e37c2af4f400eead70586ffeb345f09618803145b0d771d8","observation_id":"2d94a6d3-33dc-493a-b215-ac027f494ba4","resolution":{"observed_at":"2026-08-06T10:21:21.401198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.852594Z","title":"GShard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":"523d8cc7-f58a-4eb4-aa7e-f71a6710776a","year":null},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.404660Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:3a64b0e466db09b53c156f33ea48713e5c77012d02f28ae001b9e7a7f857fad7","observation_id":"e97382b7-74b5-40ff-9acb-2aa6f612a842","resolution":{"observed_at":"2026-08-06T10:21:21.857066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-06T10:21:21.408225Z","title":"Seed-bench: Benchmarking mul- timodal llms with generative comprehension.arXiv preprint arXiv:2307.16125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.408225Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:5d05a5e3615e9ccbc75e9d3e99cc9884d9d09d9a12af3e72bfe78406d88cddfb","observation_id":"e1280ef7-e5aa-4e2e-afc9-d1a6581f1682","resolution":{"observed_at":"2026-08-06T10:21:21.408225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.842337Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"0784fbce-d282-4089-afbf-d31b711cae67","year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.411788Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:a6bd6955b0019c34b047865e526c9534e7787b2b42bfad6fd1dbef291f26e71a","observation_id":"ba8b8395-1e75-4d1a-b2e2-4241ffd20f49","resolution":{"observed_at":"2026-08-06T10:21:21.845884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.832271Z","title":"Learning without forgetting","venue":null,"work_id":"ba59aa12-44e6-43fa-8260-5428c4119120","year":2017},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.414960Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:ceaad567def0e0e445f1052894eaa5bdf786cd639e25923852e02c2f84719f50","observation_id":"4f8163e8-6e42-49a3-ae1f-3b14c7fd1d8b","resolution":{"observed_at":"2026-08-06T10:21:21.835870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.821482Z","title":"InfLoRA: Interference-free low-rank adaptation for continual learning","venue":null,"work_id":"efd36634-8d0c-43bc-803d-70609164f375","year":2024},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.418162Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:39b6ee6639bc11b2f282c8777198fd476d1fe42101bd4be7cdae12710c0ba66e","observation_id":"3ea7bd6f-3ff7-43e2-baac-83a22dff776b","resolution":{"observed_at":"2026-08-06T10:21:21.825621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.421578Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.421578Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:a7775631a38a25437bdf1732c2dbba07cc79892f1a73e92787c60ee78e39e63d","observation_id":"444189ce-f650-444a-8d50-5e51921f735a","resolution":{"observed_at":"2026-08-06T10:21:21.421578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.424576Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.424576Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:44560a32ed4e79486691c490b55ce815ed07ed7b5060f9086fd7a3a43ed67d8a","observation_id":"1e4fc8c2-bcee-4400-86e1-ce01a0297c89","resolution":{"observed_at":"2026-08-06T10:21:21.424576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.798380Z","title":"Adaptive aggregation networks for class-incremental learning","venue":null,"work_id":"d336afa9-617f-4cc2-a186-d1130148e814","year":2021},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.427663Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:bec8c6f1e1af8e3b238a82d0a99d8cef2afebdca64b44abf31d25d9991d5318a","observation_id":"2d6433d5-c150-47ed-b400-6d06c5ff7eab","resolution":{"observed_at":"2026-08-06T10:21:21.802726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.786934Z","title":"Unified-IO 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":"af21d060-cc8c-42b2-86a9-235bf6300c05","year":2024},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.430584Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:04d687e01d6a5cddb07b919801b8f8425de82d04ee10d02d724799be52e135e2","observation_id":"11518c7f-6194-43b9-b38f-a2c4eae7dfa6","resolution":{"observed_at":"2026-08-06T10:21:21.791017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.775870Z","title":"Not all ex- perts are equal: Efficient expert pruning and skipping for mixture-of-experts large language models","venue":null,"work_id":"1eea8289-ba2e-43f6-8e16-2d8cd1c2f860","year":2024},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.433965Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:0703fb65e2de457acdcb8c6b864c41005f094e2762e4ac31dd45a8431ad7d3eb","observation_id":"61fee644-8cda-467b-9d08-33eb3dd9dfbb","resolution":{"observed_at":"2026-08-06T10:21:21.779647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.764683Z","title":"Catastrophic inter- ference in connectionist networks: The sequential learning problem","venue":null,"work_id":"e2877406-e947-4156-ad0d-4cd816db7fd2","year":1989},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.437007Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:f54eed2ddb9506622c52da8f410e55112a8bc527eaa790fceafd9db24f547033","observation_id":"cf2acef6-ec07-4ca3-a677-6d4a9ef772d6","resolution":{"observed_at":"2026-08-06T10:21:21.768403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.754722Z","title":"Multimodal contrastive learn- ing with limoe: the language-image mixture of experts.Ad- vances in Neural Information Processing Systems, 35:9564– 9576, 2022","venue":null,"work_id":"48f733e8-2bdf-43e3-bb04-af16cd3f1fb4","year":2022},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.440162Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:42d81da2314a32e766faad2189ca32d76e9f0ed6f9ff8667f26cff2bd5d16350","observation_id":"512af70e-e130-4b8b-a7f1-7c739dff4727","resolution":{"observed_at":"2026-08-06T10:21:21.758311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.743725Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models.Interna- tional Journal of Computer Vision, 123:74–93, 2017","venue":null,"work_id":"42c11bb4-451d-413b-860e-0a6f50e8ba71","year":2017},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.443261Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:c16b045b27218577095802789cc4596153fe250e83b615935c2fa2daaf2c4b8a","observation_id":"c68e684d-ac33-46b2-aa90-aa2bb7345d87","resolution":{"observed_at":"2026-08-06T10:21:21.748323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.446302Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.446302Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:5a53da631e390eade1ad2bd83e0684d02b3d6d9379d72b9b55004c788d8505f6","observation_id":"fa114b31-03a8-4d3c-bf60-47870e7f9285","resolution":{"observed_at":"2026-08-06T10:21:21.446302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.727529Z","title":"iCaRL: Incremental clas- sifier and representation learning","venue":null,"work_id":"7dfe15c2-689e-4cf6-a326-c3a4232402ef","year":2001},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.449652Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:40f37707985eab5d5a6884740a10e7cfc65b6fa8c46b437fc5f7b355d4ced3a9","observation_id":"7dc32692-beca-432e-8e4b-17fde4ca2554","resolution":{"observed_at":"2026-08-06T10:21:21.730959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.717144Z","title":"Exploring models and data for image question answering.Advances in neural information processing systems, 28, 2015","venue":null,"work_id":"a7ae22b8-2729-44d7-a387-53fa3558200a","year":2015},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.452679Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:2e08a64331c0981680ca93e809a54974cca9548379501c385d7dfa92e3bdf95e","observation_id":"b83644da-00c9-4940-8e7b-e4593c362396","resolution":{"observed_at":"2026-08-06T10:21:21.720656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-06T10:21:21.455817Z","title":"Outra- geously large neural networks: The sparsely-gated mixture- of-experts layer.arXiv preprint arXiv:1701.06538, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.455817Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:69a51adc8b0f41a5def05110033791b6073fbf9e7223077dc44dcd8a9d7e7d38","observation_id":"aa84c749-4020-40f3-b455-7c2192d7ba52","resolution":{"observed_at":"2026-08-06T10:21:21.455817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.707167Z","title":"CODA-prompt: Con- tinual decomposed attention-based prompting for rehearsal- free continual learning","venue":null,"work_id":"1bf58341-7d9a-4169-ad37-777eb6a3bde4","year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.459384Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:3376edf0c8bd5c44c921a2eaa727a72283404e8c70c197b627f8afef280d3dc3","observation_id":"90f5229b-c3f4-48f0-8f8f-30b2dbec25f2","resolution":{"observed_at":"2026-08-06T10:21:21.710769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.697182Z","title":"Constrained contrastive distribution learning for unsupervised anomaly detection and localisation in med- ical images","venue":null,"work_id":"6915c961-bd8a-43d3-b068-4113688eb5d4","year":2021},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.463488Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:975297bc6db660f1fa549366e115c79a934c15ea7d28b12426397e20a2ab6ddc","observation_id":"b5ad4abf-dce0-4b27-9427-29e05c0955ae","resolution":{"observed_at":"2026-08-06T10:21:21.700593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T10:21:21.467333Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.467333Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:22db8ff12cc7b45c62724d7c786ce3d72d7ca0e7cac7b215ca2140df39d25d2d","observation_id":"1655feca-8306-4c3c-b6c9-47273b294f71","resolution":{"observed_at":"2026-08-06T10:21:21.467333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.686900Z","title":"DualPrompt: Complementary prompting for rehearsal-free continual learning","venue":null,"work_id":"746d8662-6c9c-4d3c-bc1f-5836b9d50baf","year":null},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.470608Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:791b81cadf35766675c60fbd561c86c1e8f6b84ff484e9e46f367004780056d5","observation_id":"3da1cda1-5e60-4ce3-85fe-caed156eca0f","resolution":{"observed_at":"2026-08-06T10:21:21.690408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.474330Z","title":"Learning to prompt for con- tinual learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.474330Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:2e5de860479a7c6bd2c9f4e59b9459ae0129d66dff2018e5f713a88f84566961","observation_id":"e34c4a4b-b655-4c20-8fb9-5dba204c4ec0","resolution":{"observed_at":"2026-08-06T10:21:21.474330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-06T10:21:21.478032Z","title":"mPLUG-OWl: Modularization empowers large language models with multimodality.arXiv preprint arXiv:2304.14178, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.478032Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:b16c3c0eadac8fa936f4317d118c48eb5f66352fcb4d14cee751d26a65261c42","observation_id":"85a0656a-f59d-4f0a-96d5-9010d31056c4","resolution":{"observed_at":"2026-08-06T10:21:21.478032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.670714Z","title":"Boosting continual learning of vision-language models via mixture-of-experts adapters","venue":null,"work_id":"ad816138-eebf-43a0-87f4-1154842ba6f6","year":2024},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.481597Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:ef4883290382877ad58f705ddb215fc260b64e8f634f4f3a75122bd9a596fc00","observation_id":"0e2c69be-6c75-40ee-a6d0-ba572582c434","resolution":{"observed_at":"2026-08-06T10:21:21.674647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.660486Z","title":"Contin- ual learning through synaptic intelligence","venue":null,"work_id":"55ad3117-1412-4503-b1cd-8ef8e0fdabd5","year":2017},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.485352Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:9a1698c1c84b3af18440eda9454c8ede31376ce034a55851c650f65704028bf5","observation_id":"15c32d4d-2942-4925-a2f2-e79a44d2b491","resolution":{"observed_at":"2026-08-06T10:21:21.664041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.649182Z","title":"Investigating the catastrophic for- getting in multimodal large language models","venue":null,"work_id":"22815a36-bc05-4ab1-82f1-6909693042ca","year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.489745Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:cac7389d3ac4d28ec01f928dee320b5d802bbaf458958d411db2ddf96a1bafdb","observation_id":"34554ce1-1655-4f89-9000-5f55e38d0500","resolution":{"observed_at":"2026-08-06T10:21:21.653638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15684","last_updated":"2024-05-24T16:24:10Z","snapshot_observed_at":"2026-07-06T18:19:25.869339Z","submitted_at":"2024-05-24T16:24:10Z","title":"Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2405.15684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.15684","snapshot_observed_at":"2026-08-06T10:21:21.540241Z","title":"Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models","venue":"cs.CV","work_id":"22b75ed9-1461-4ff0-8ea6-b501d6ab880b","year":2024},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.493130Z"},"links":{"cited_paper":"/paper/2405.15684","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:cf6fd4078a40e0f6493980a924c9b8d09159579bc2395a3629b0e05df674595f","observation_id":"128e48f9-fff9-4e9f-b946-457d78234640","resolution":{"observed_at":"2026-08-06T10:21:21.546029Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.638048Z","title":"Preventing zero-shot transfer degradation in continual learning of vision-language models","venue":null,"work_id":"2ed9d7ec-7295-4270-9fe4-0b2d60b15104","year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.496493Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:b029a19be2252dbad52e4a936d7bad52a18927095db1f29cb86b1122d7e0e0bd","observation_id":"7893dd5b-5c4d-451e-a26d-18c1465b73f8","resolution":{"observed_at":"2026-08-06T10:21:21.642002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T10:21:21.500180Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.500180Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:1b1c3b636710765d081bf60cc2d92b4d7d4e4d695190c48b05aa6463b67d6deb","observation_id":"904ad81f-2db6-4e47-bd45-2d68bd2ff969","resolution":{"observed_at":"2026-08-06T10:21:21.500180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":39},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2508.00260."}