{"as_of":"2026-08-16T01:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9614e4be9ecad4893f8d85b8de9d77d67660a03a442f55e4d9dcd80f8dfc6d57","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:05:19.425102Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02830/citation-record","integrity":"/paper/2608.02830/integrity","json":"/paper/2608.02830/citation-record.json","paper":"/paper/2608.02830"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:20.247822Z","title":"Advances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":"de61eff9-441e-466e-906b-ca365d99bed1","year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.178058Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:c4a6ddd52fd314297de383912c7c6b4c5adb8f8913c9334c6e303cf4772f1386","observation_id":"f74844ff-3eb6-4ec1-ad49-3f41c5e6e154","resolution":{"observed_at":"2026-08-15T15:05:20.251879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-15T15:05:19.183255Z","title":"NeurIPS 2022 arXiv:2204.14198","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.183255Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:3d4fb8625f05d08ac9fef88de286006d0909343e2b71ae744976df7427caf503","observation_id":"1ae0ff46-6ca4-41ae-8df0-0c00860dfcf3","resolution":{"observed_at":"2026-08-15T15:05:19.183255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00647","last_updated":"2022-09-01T17:59:33Z","snapshot_observed_at":"2026-08-15T08:28:27.744915Z","submitted_at":"2022-09-01T17:59:33Z","title":"Visual Prompting via Image Inpainting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00647","snapshot_observed_at":"2026-08-15T15:05:19.187888Z","title":"NeurIPS 2022 arXiv:2209.00647","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.187888Z"},"links":{"cited_paper":"/paper/2209.00647","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:a4033b1509cc263b4b44dde91b9536fe635a90a787cf6eea93f4163bcbb0e6a6","observation_id":"76be4683-5642-4e41-ab7e-25354952c26d","resolution":{"observed_at":"2026-08-15T15:05:19.187888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:20.236070Z","title":"In: Advances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":"f92e08c4-fc92-4daa-aa09-850c282c80e2","year":2020},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.192879Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:55bc7eed8b7b03f906fc40d870593d01ec2c0d4a685916f88bbb8691d625f427","observation_id":"c91a7ee2-a6c9-4aba-9815-f2c92fe582cf","resolution":{"observed_at":"2026-08-15T15:05:20.239969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07211","last_updated":"2020-10-22T14:00:23Z","snapshot_observed_at":"2026-08-15T17:05:42.828926Z","submitted_at":"2020-04-15T17:13:05Z","title":"Dark Experience for General Continual Learning: a Strong, Simple Baseline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07211","snapshot_observed_at":"2026-08-15T15:05:19.197206Z","title":"NeurIPS 2020 arXiv:2004.07211","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.197206Z"},"links":{"cited_paper":"/paper/2004.07211","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:1821bd217e8ad9717611619d05d5e0e523cb8b603271b5d961c09df85b529bfd","observation_id":"6ecef90c-5666-4389-8654-a1c1814fede3","resolution":{"observed_at":"2026-08-15T15:05:19.197206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1613/jair.1.17940","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:19.488862Z","title":"Journal of Artificial Intelligence Research 83","venue":null,"work_id":"de8484eb-51f9-4d3d-b89a-be758d663291","year":2025},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.202052Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:2cf249476ae7a9872fce78f21f09cdea9bfc527f8473a7680689d05f9079bc75","observation_id":"82f2879f-c12c-43f9-94d6-06b399106300","resolution":{"observed_at":"2026-08-15T15:05:19.493578Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15275","last_updated":"2024-01-27T03:03:30Z","snapshot_observed_at":"2026-08-13T07:35:28.853160Z","submitted_at":"2024-01-27T03:03:30Z","title":"Dynamic Transformer Architecture for Continual Learning of Multimodal Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15275","snapshot_observed_at":"2026-08-15T15:05:19.206333Z","title":"Neurocomputing https://doi.org/10.1016/j.neucom.2025","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.206333Z"},"links":{"cited_paper":"/paper/2401.15275","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:09fc258a0dc0bd196feb0dca195af90319d1d42e18bd2dcea6cbf3981c1504ce","observation_id":"8bc23db6-8638-4009-b64d-d223cd56d6bb","resolution":{"observed_at":"2026-08-15T15:05:19.206333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:20.225326Z","title":"In: Findings of the Association for Computational Linguistics: EMNLP 2023","venue":null,"work_id":"6b77c0cf-8a6a-4ab7-bc1f-c2812eb8fc80","year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.211156Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:a24176e9f87223f3600372b7bbca63657884ca4440972aff51af3e29cdcdde71","observation_id":"4c91a0bf-4c08-49e0-80b0-c3b1d403716c","resolution":{"observed_at":"2026-08-15T15:05:20.229022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.00420","last_updated":"2019-01-09T11:11:47Z","snapshot_observed_at":"2026-08-15T06:05:04.839393Z","submitted_at":"2018-12-02T16:39:19Z","title":"Efficient Lifelong Learning with A-GEM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.00420","snapshot_observed_at":"2026-08-15T15:05:19.215000Z","title":"ICLR 2019 arXiv:1812.00420","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.215000Z"},"links":{"cited_paper":"/paper/1812.00420","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:70b100bc053030ce44fd70ef22f777a7d2c4d71e85e9df451553fd1392407854","observation_id":"95009d97-308c-4035-8562-4a5a777567cf","resolution":{"observed_at":"2026-08-15T15:05:19.215000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08350","last_updated":"2024-10-23T02:16:37Z","snapshot_observed_at":"2026-08-13T00:55:22.301508Z","submitted_at":"2024-03-13T08:54:31Z","title":"CoIN: A Benchmark of Continual Instruction tuNing for Multimodel Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08350","snapshot_observed_at":"2026-08-15T15:05:19.219948Z","title":"NeurIPS 2024 arXiv:2403.08350","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.219948Z"},"links":{"cited_paper":"/paper/2403.08350","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:5d733cdcd60fa011fd75020a6b234bc925b719678249b15bcd30f4f96c6356bf","observation_id":"02474b9f-7276-4ed0-9057-33179de12e1c","resolution":{"observed_at":"2026-08-15T15:05:19.219948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-15T15:05:19.224407Z","title":"CVPR 2024 arXiv:2312.14238","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.224407Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:ac509d90aaf747c5479aa7829b16573cefbcb3bf57a9b3544da6610c7f1e5681","observation_id":"71f8a4f3-0c85-4ea4-9d42-20a71d325e3c","resolution":{"observed_at":"2026-08-15T15:05:19.224407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:19.228317Z","title":"arXiv 2024 arXiv:2412.14133","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.228317Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:6e84ce737a8f9db8d5b2ac50b7aa3e9a4a95bafa3636526e9d7999e175000229","observation_id":"bc47f6a0-a5fc-48f4-8ca2-83499c1f7a21","resolution":{"observed_at":"2026-08-15T15:05:19.228317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-15T15:05:19.232157Z","title":"NeurIPS 2023 arXiv:2305.06500","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.232157Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:a1298f05cef44904208cb973450da658053d3b75fb58b194ac644c68d5dd81ce","observation_id":"12fefd31-8a7d-416b-b172-c493c7cd75f2","resolution":{"observed_at":"2026-08-15T15:05:19.232157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:20.213257Z","title":"arXiv preprint arXiv:240721783","venue":null,"work_id":"170a1c7a-4872-4864-93b5-07464ca41fa8","year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.236035Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:904e569a2e8c6b58c37e9f76c1c10f00878b981d25743426b326792f4c241e57","observation_id":"071a472c-c60a-4c7a-a006-c603b5745abc","resolution":{"observed_at":"2026-08-15T15:05:20.217510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16320","last_updated":"2025-02-07T20:56:08Z","snapshot_observed_at":"2026-08-12T23:36:29.628366Z","submitted_at":"2024-06-24T05:13:19Z","title":"What Do VLMs NOTICE? A Mechanistic Interpretability Pipeline for Gaussian-Noise-free Text-Image Corruption and Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16320","snapshot_observed_at":"2026-08-15T15:05:19.239990Z","title":"NeurIPS 2024 arXiv:2406.16320","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.239990Z"},"links":{"cited_paper":"/paper/2406.16320","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:fbda99e547827b63db3161ff6c61de264a960dddbbea01ff53291140e0bfdf76","observation_id":"c95a98e6-c24f-4e63-8bb4-ceb56c8ca4a6","resolution":{"observed_at":"2026-08-15T15:05:19.239990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15916","last_updated":"2023-10-24T15:17:14Z","snapshot_observed_at":"2026-08-13T05:42:05.425097Z","submitted_at":"2023-10-24T15:17:14Z","title":"In-Context Learning Creates Task Vectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15916","snapshot_observed_at":"2026-08-15T15:05:19.244570Z","title":"EMNLP 2023 arXiv:2310.15916","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.244570Z"},"links":{"cited_paper":"/paper/2310.15916","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:375633f8d6ca01f27c51f496c14412580e44da56b10129cdabe852e881199ee9","observation_id":"47cbfc79-76cf-4e78-b84b-64cf24d85afa","resolution":{"observed_at":"2026-08-15T15:05:19.244570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-15T15:05:19.248324Z","title":"ICLR 2022 arXiv:2106.09685","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.248324Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:ce7c56b50a0829381ecc716b095c68d0a31e4b8dc351c6f46148049d3eba3c9c","observation_id":"f66645ce-bfcf-4610-adde-78c8fbac5805","resolution":{"observed_at":"2026-08-15T15:05:19.248324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08803","last_updated":"2025-05-10T22:42:29Z","snapshot_observed_at":"2026-08-15T22:31:16.482388Z","submitted_at":"2025-05-10T22:42:29Z","title":"Multi-modal Synthetic Data Training and Model Collapse: Insights from VLMs and Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08803","snapshot_observed_at":"2026-08-15T15:05:19.252415Z","title":"arXiv preprint arXiv:250508803 URL https://arxiv.org/abs/2505.08803","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.252415Z"},"links":{"cited_paper":"/paper/2505.08803","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:c534de5022944ddb1cbe58ebccbaa1eb9d4adbfc95613b8bbf0183c694abbcf4","observation_id":"81a55e4c-ed6b-4d49-8a37-69991462b877","resolution":{"observed_at":"2026-08-15T15:05:19.252415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15334","last_updated":"2024-12-20T01:24:51Z","snapshot_observed_at":"2026-08-12T23:37:19.817513Z","submitted_at":"2024-06-21T17:50:02Z","title":"Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15334","snapshot_observed_at":"2026-08-15T15:05:19.256230Z","title":"NeurIPS 2024 arXiv:2406.15334","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.256230Z"},"links":{"cited_paper":"/paper/2406.15334","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:b5fe7736f53b219692d039d847628d50de292c52eea735cb662ee8ed8889b046","observation_id":"76b08a8e-690f-4024-9cb9-390ca9ab9bd3","resolution":{"observed_at":"2026-08-15T15:05:19.256230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-15T04:47:39.586346Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07936","snapshot_observed_at":"2026-08-15T15:05:19.260230Z","title":"arXiv 2025 arXiv:2506.07936","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.260230Z"},"links":{"cited_paper":"/paper/2506.07936","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:0ff648b6e7b6d4e9da2754cb53f531ca336111201a691812ebfb196b1031323a","observation_id":"79b16fc2-0d09-489b-b9a6-846b65495a2c","resolution":{"observed_at":"2026-08-15T15:05:19.260230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:20.199552Z","title":"In: Advances in Neural Information Processing Systems (NeurIPS) 43","venue":null,"work_id":"9e95188e-ea11-424f-987c-e06a1139854e","year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.264258Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:f9f09cd275fafb4144b62b46d56c3df37ed7cd06abf7d302c650870fa52865bd","observation_id":"52920aff-d188-439c-858f-fd317f8be273","resolution":{"observed_at":"2026-08-15T15:05:20.203784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09798","last_updated":"2024-10-04T21:51:47Z","snapshot_observed_at":"2026-08-14T13:44:21.475363Z","submitted_at":"2024-05-16T04:02:43Z","title":"Many-Shot In-Context Learning in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09798","snapshot_observed_at":"2026-08-15T15:05:19.268015Z","title":"arXiv 2024 arXiv:2405.09798","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.268015Z"},"links":{"cited_paper":"/paper/2405.09798","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:b118c7c8167fca4eae1654fe0d5fe1bd99e9475ae4f49e179cb464c13b4bd93b","observation_id":"6b08c0e2-cb6d-4a25-a925-a9af27946d64","resolution":{"observed_at":"2026-08-15T15:05:19.268015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-15T17:04:51.149948Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17491","snapshot_observed_at":"2026-08-15T15:05:19.272138Z","title":"arXiv 2024 arXiv:2411.17491","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.272138Z"},"links":{"cited_paper":"/paper/2411.17491","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:d92dc26c91516008c3331aa3c2edb02f97d808fbaff26b5a19cd5f5faac86821","observation_id":"f90f76b3-eed1-4a3b-a13a-947ff61d0e32","resolution":{"observed_at":"2026-08-15T15:05:19.272138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.00796","last_updated":"2017-01-25T13:01:51Z","snapshot_observed_at":"2026-08-14T21:27:22.270542Z","submitted_at":"2016-12-02T19:18:37Z","title":"Overcoming catastrophic forgetting in neural networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.00796","snapshot_observed_at":"2026-08-15T15:05:19.276334Z","title":"PNAS 2017 arXiv:1612.00796","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.276334Z"},"links":{"cited_paper":"/paper/1612.00796","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:77f99341e17222f8581bd8a400addd20d0c21c4dcbd85c0a57afbb0acf146622","observation_id":"9927410c-d1df-43e8-89b0-7c8d9e49388c","resolution":{"observed_at":"2026-08-15T15:05:19.276334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:19.280178Z","title":"Trends in Cognitive Sciences https://doi.org/10.1016/j.tics.2016.05.004","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.280178Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:c288b35946ccf7be7b604d8648eec5a67ccb5e8729ea61d0cc4cd1bca22d77d6","observation_id":"dbf68df3-175f-4220-8b38-15c2a3151cc7","resolution":{"observed_at":"2026-08-15T15:05:19.280178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08383","last_updated":"2021-04-16T17:53:39Z","snapshot_observed_at":"2026-08-14T06:15:15.247174Z","submitted_at":"2019-09-18T12:07:36Z","title":"A continual learning survey: Defying forgetting in classification tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08383","snapshot_observed_at":"2026-08-15T15:05:19.285101Z","title":"TPAMI 2022 arXiv:1909.08383","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.285101Z"},"links":{"cited_paper":"/paper/1909.08383","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:829da2b9d6204236914ef6281dacd2a6ee8ee51f9ee6c1fa8c410a1ea7a134ea","observation_id":"584b9f23-d215-4d3e-adae-9588235b265f","resolution":{"observed_at":"2026-08-15T15:05:19.285101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-15T15:05:19.289138Z","title":"arXiv 2023 arXiv:2305.03726","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.289138Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:9c7e43b0f9df3512e5e59e93323f58878e634f4047fd0df13ad02a6cf4d86faf","observation_id":"aa76d43c-d326-456c-a518-e0061dcb18b9","resolution":{"observed_at":"2026-08-15T15:05:19.289138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-15T15:05:19.292993Z","title":"TMLR 2024 arXiv:2408.03326","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.292993Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:012835949bbd1e2586f749f9c845a52408538a6b1e7a535affc04e1e13b014c7","observation_id":"60052c5c-a8e0-4d7d-a0f5-94c80338b00d","resolution":{"observed_at":"2026-08-15T15:05:19.292993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-15T15:05:19.296654Z","title":"ICML 2023 arXiv:2301.12597","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.296654Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:5d722524bd573b13b0c0ae53ecbabb181885f8b0d038eb34290ec622edb01977","observation_id":"3c3b5ae9-c88e-415e-bccc-4e5a9c3159a6","resolution":{"observed_at":"2026-08-15T15:05:19.296654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:19.301116Z","title":"arXiv 2025 arXiv:2505.17097","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.301116Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:4d3a016945db4ede46aa189962fb7d7322943a93a97cbbdde89fba3419c15fcc","observation_id":"b9ebb8ac-5054-4630-9e1a-78748b6c0c55","resolution":{"observed_at":"2026-08-15T15:05:19.301116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.09282","last_updated":"2017-02-14T22:32:30Z","snapshot_observed_at":"2026-08-14T21:50:32.277966Z","submitted_at":"2016-06-29T20:54:04Z","title":"Learning without Forgetting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.09282","snapshot_observed_at":"2026-08-15T15:05:19.305084Z","title":"TPAMI 2018 arXiv:1606.09282","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.305084Z"},"links":{"cited_paper":"/paper/1606.09282","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:c113819d468f389724838790e64537a08a53466fbd04cefae0990467c60178cb","observation_id":"369a27c6-6c77-463d-bbc2-b2323da27985","resolution":{"observed_at":"2026-08-15T15:05:19.305084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-15T15:05:19.309022Z","title":"NeurIPS 2023 arXiv:2304.08485","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.309022Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:47085c2f229a7e29f3e6ee39a3929d88f5c1ee60f57d72dd9f205cffd6f941ad","observation_id":"b4bd3689-cf02-4616-a4bb-e66ca89bba0d","resolution":{"observed_at":"2026-08-15T15:05:19.309022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08840","last_updated":"2022-09-13T14:47:52Z","snapshot_observed_at":"2026-08-14T20:51:36.916558Z","submitted_at":"2017-06-26T14:53:34Z","title":"Gradient Episodic Memory for Continual Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08840","snapshot_observed_at":"2026-08-15T15:05:19.313510Z","title":"NeurIPS 2017 arXiv:1706.08840","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.313510Z"},"links":{"cited_paper":"/paper/1706.08840","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:e54bf2d591eaf0b62fc6fb8dbcdd153b77eb6119dfda4c3ec57b1a50f34b67a4","observation_id":"638ddf3a-f6b3-4d63-83cf-64e82b773808","resolution":{"observed_at":"2026-08-15T15:05:19.313510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:19.318421Z","title":"Psychological Review https://doi.org/10.1037/0033-295X.102.3.419","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.318421Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:3c75400bf52ea381ef3f4209f4387cd64c265a21b47bdfd70260f078336a1ef8","observation_id":"a79ee736-072d-4e91-80f3-82333184b69a","resolution":{"observed_at":"2026-08-15T15:05:19.318421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-15T15:05:19.322782Z","title":"arXiv 2024 arXiv:2410.07149","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.322782Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:25fdb8826f331b47fc03fe576e444b4772bd45d24ddd6479c19259dbbfd6b3df","observation_id":"50382040-ffb6-4c4d-abe3-c81d5e2e99b2","resolution":{"observed_at":"2026-08-15T15:05:19.322782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:20.187391Z","title":"Transformer Circuits Thread 44","venue":null,"work_id":"64270d14-4d52-476c-b703-8cf4611a94bd","year":2022},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.327235Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:97d32e4a20ecec3ad20f85daeccc740a4146eda550ff08b3c905c5c1c2c29fca","observation_id":"5dc28149-1802-4d98-8920-741b3fe64803","resolution":{"observed_at":"2026-08-15T15:05:20.191375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:19.331449Z","title":"Cognitive Science https://doi.org/10.1111/j.1551-6709.2011.01214","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.331449Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:57bc65097f22b699b63c37f935cc171bc578d59da793f6eb2af2d94023857dea","observation_id":"b806ccf2-72d2-40db-9327-15dbafb38dc8","resolution":{"observed_at":"2026-08-15T15:05:19.331449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14179","last_updated":"2023-08-27T18:46:47Z","snapshot_observed_at":"2026-08-13T10:26:51.536712Z","submitted_at":"2023-08-27T18:46:47Z","title":"Towards Vision-Language Mechanistic Interpretability: A Causal Tracing Tool for BLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14179","snapshot_observed_at":"2026-08-15T15:05:19.335656Z","title":"ICCV Workshop 2023 arXiv:2308.14179","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.335656Z"},"links":{"cited_paper":"/paper/2308.14179","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:1a31ae7662e4f65f7a32212f6fa414e25ef02766ff0666e0d55f6336aa7e2e2f","observation_id":"1b186def-d134-4e7f-8fd5-23b9b74b89a5","resolution":{"observed_at":"2026-08-15T15:05:19.335656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.07725","last_updated":"2017-04-14T16:41:02Z","snapshot_observed_at":"2026-08-14T21:29:01.299545Z","submitted_at":"2016-11-23T10:24:11Z","title":"iCaRL: Incremental Classifier and Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.07725","snapshot_observed_at":"2026-08-15T15:05:19.340166Z","title":"CVPR 2017 arXiv:1611.07725","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.340166Z"},"links":{"cited_paper":"/paper/1611.07725","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:d9cece8e83ad7b9b61555bc887a1c4cdca77ce1bf12791a652a53d04e2dd4f1f","observation_id":"f2a6ed3f-4c3f-4bb6-b31c-7875a2a394fb","resolution":{"observed_at":"2026-08-15T15:05:19.340166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:20.174779Z","title":"In: Proceedings of the Thirty-Second International Joint Conference on Artificial Intelligence (IJCAI-23), pp 3058–3066, https://doi.org/10.24963/ ijcai.2023/341","venue":null,"work_id":"8495ae8d-0bd2-4566-bc7e-11899da4446b","year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.344231Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:c603e0d62f8c8c14c4252a6150ab29de5b0aec1e4f77d605c7965144d60e209f","observation_id":"e5774569-3d49-4a78-b896-9ea02c2c86c9","resolution":{"observed_at":"2026-08-15T15:05:20.179311Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1073/pnas.2502194122","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:19.461888Z","title":"PNAS https://doi.org/ 10.1073/pnas.2502194122","venue":null,"work_id":"e205dadc-7a78-4998-a881-7edc1c1bc7d0","year":2025},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.348266Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:2dc4c825f3427502fc02a05dd5a54095886beb8d7cd0167e6dfa69fa93a9d5a6","observation_id":"c3d3b701-149d-48ec-a4fe-471d21758fff","resolution":{"observed_at":"2026-08-15T15:05:19.466673Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.08690","last_updated":"2017-12-12T02:14:21Z","snapshot_observed_at":"2026-08-14T20:58:31.577053Z","submitted_at":"2017-05-24T10:37:38Z","title":"Continual Learning with Deep Generative Replay","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.08690","snapshot_observed_at":"2026-08-15T15:05:19.352367Z","title":"NeurIPS 2017 arXiv:1705.08690","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.352367Z"},"links":{"cited_paper":"/paper/1705.08690","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:fe36550b791cbba1bdf0602f260b33aba32bf72a72f452144f00bfb54a7dd584","observation_id":"492ee162-1ae2-417e-bc59-a92c25b8b532","resolution":{"observed_at":"2026-08-15T15:05:19.352367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.09059","last_updated":"2022-11-24T21:40:45Z","snapshot_observed_at":"2026-08-15T13:18:49.633322Z","submitted_at":"2022-06-18T00:16:37Z","title":"CLiMB: A Continual Learning Benchmark for Vision-and-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.09059","snapshot_observed_at":"2026-08-15T15:05:19.356578Z","title":"In: Advances in Neural Information Processing Systems, pp 29440–29453, URL https://arxiv.org/abs/2206.09059","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.356578Z"},"links":{"cited_paper":"/paper/2206.09059","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:7c52367293f3f9674ab193b0baab7098794aca34eb1c6dd012efc3a2e0b181ad","observation_id":"724ccdc1-0fc3-48d2-ade9-819970cae487","resolution":{"observed_at":"2026-08-15T15:05:19.356578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.03329","last_updated":"2019-12-23T04:36:52Z","snapshot_observed_at":"2026-08-14T16:41:59.624463Z","submitted_at":"2019-09-07T20:17:34Z","title":"LAMOL: LAnguage MOdeling for Lifelong Language Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.03329","snapshot_observed_at":"2026-08-15T15:05:19.361167Z","title":"ICLR 2020 arXiv:1909.03329","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.361167Z"},"links":{"cited_paper":"/paper/1909.03329","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:745f88a8fc8a4eb49494872c77d3c626709ad10e68bb539badeefdfa618a64cc","observation_id":"1b159283-559a-40b4-8461-3a3cb68f730e","resolution":{"observed_at":"2026-08-15T15:05:19.361167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07891","last_updated":"2023-08-15T17:33:24Z","snapshot_observed_at":"2026-08-13T10:34:09.343292Z","submitted_at":"2023-08-15T17:33:24Z","title":"Link-Context Learning for Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07891","snapshot_observed_at":"2026-08-15T15:05:19.364721Z","title":"CVPR 2024 arXiv:2308.07891","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.364721Z"},"links":{"cited_paper":"/paper/2308.07891","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:2ab7c2a7b1dfb7f1389ec536960bcb66942f59c5c8f911de08eff43cbc6c26a8","observation_id":"a1efc656-47c3-422e-b405-b3af7c242a2a","resolution":{"observed_at":"2026-08-15T15:05:19.364721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15213","last_updated":"2024-02-25T18:32:18Z","snapshot_observed_at":"2026-08-13T05:42:53.020730Z","submitted_at":"2023-10-23T17:55:24Z","title":"Function Vectors in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15213","snapshot_observed_at":"2026-08-15T15:05:19.368465Z","title":"ICLR 2024 arXiv:2310.15213","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.368465Z"},"links":{"cited_paper":"/paper/2310.15213","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:4490db103ee1ab44edc371d782ca88942f1eb3bafed70186e938f738ecfbca0c","observation_id":"1d1724d7-c52b-46f7-afa6-2b410edc3460","resolution":{"observed_at":"2026-08-15T15:05:19.368465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13884","last_updated":"2021-07-03T10:04:41Z","snapshot_observed_at":"2026-08-15T15:12:43.971562Z","submitted_at":"2021-06-25T21:07:09Z","title":"Multimodal Few-Shot Learning with Frozen Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13884","snapshot_observed_at":"2026-08-15T15:05:19.372276Z","title":"NeurIPS 2021 arXiv:2106.13884","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.372276Z"},"links":{"cited_paper":"/paper/2106.13884","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:5061b23954283323df5afcc8a5f2bca8d4061150c8ac54521255404e8692b77d","observation_id":"418b4464-2876-482f-803f-f471fada2715","resolution":{"observed_at":"2026-08-15T15:05:19.372276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:19.376053Z","title":"Nature Machine Intelligence https://doi.org/10.1038/s42256-022-00568-3","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.376053Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:a774cb86ecce0db675d50efe63ac1c39c3c2e351c22afc9712735d762d6a6dfa","observation_id":"d768e64a-84ac-4b15-a3b5-14838c166ba8","resolution":{"observed_at":"2026-08-15T15:05:19.376053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T15:05:19.380105Z","title":"arXiv 2024 arXiv:2409.12191","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.380105Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:84f5a956107b09d3207893907f3590b5541d276ae247568a5b2812c120de9124","observation_id":"1efa80e3-2e31-41d8-a17d-09d3b0a85b2e","resolution":{"observed_at":"2026-08-15T15:05:19.380105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.02499","last_updated":"2023-03-24T07:10:47Z","snapshot_observed_at":"2026-08-13T13:27:54.563988Z","submitted_at":"2022-12-05T18:59:50Z","title":"Images Speak in Images: A Generalist Painter for In-Context Visual Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.02499","snapshot_observed_at":"2026-08-15T15:05:19.384316Z","title":"CVPR 2023 arXiv:2212.02499 45","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.384316Z"},"links":{"cited_paper":"/paper/2212.02499","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:77aed3e11ba7d869cabf613afaf4a30635a7aa2afbbebfe450bab66318b4c650","observation_id":"f62b34ac-89e4-4bd2-9a3f-4b1ba6d66a16","resolution":{"observed_at":"2026-08-15T15:05:19.384316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14152","last_updated":"2023-10-22T02:23:44Z","snapshot_observed_at":"2026-08-13T18:59:18.024748Z","submitted_at":"2023-10-22T02:23:44Z","title":"Orthogonal Subspace Learning for Language Model Continual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14152","snapshot_observed_at":"2026-08-15T15:05:19.388456Z","title":"EMNLP 2023 arXiv:2310.14152","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.388456Z"},"links":{"cited_paper":"/paper/2310.14152","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:a839daf12cc5a3b6eed10fb27504f0a7b9cd4b1cd902fdae28680c2ad753e6a7","observation_id":"ed66c1cf-0541-4d8f-a9c0-f03302a03cbd","resolution":{"observed_at":"2026-08-15T15:05:19.388456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03284","last_updated":"2023-04-06T17:59:57Z","snapshot_observed_at":"2026-08-14T16:33:52.281080Z","submitted_at":"2023-04-06T17:59:57Z","title":"SegGPT: Segmenting Everything In Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03284","snapshot_observed_at":"2026-08-15T15:05:19.393016Z","title":"ICCV 2023 arXiv:2304.03284","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.393016Z"},"links":{"cited_paper":"/paper/2304.03284","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:b4f50ebc69deebd603ffd67aa771d52e6e00d741c8d352f6e348a4d650eb0779","observation_id":"cb23eb8b-acfa-4f7c-b8a1-017299a918b8","resolution":{"observed_at":"2026-08-15T15:05:19.393016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13949","last_updated":"2025-07-01T10:40:05Z","snapshot_observed_at":"2026-08-14T05:06:13.974017Z","submitted_at":"2024-11-21T09:00:15Z","title":"SMoLoRA: Exploring and Defying Dual Catastrophic Forgetting in Continual Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13949","snapshot_observed_at":"2026-08-15T15:05:19.396732Z","title":"arXiv 2024 arXiv:2411.13949","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.396732Z"},"links":{"cited_paper":"/paper/2411.13949","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:b1279272b130037c73a18c1fc413843a26710464496c3eb378ff505dd505bdb0","observation_id":"6c8abf86-3680-4fbe-adea-4defd6c7ad1a","resolution":{"observed_at":"2026-08-15T15:05:19.396732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:20.162243Z","title":"arXiv preprint arXiv:251005024","venue":null,"work_id":"de6d9982-e4ef-4273-a168-02d3515a3ebc","year":2025},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.400714Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:a3c4aed470ff50ce8367e94facda5fa05f586690f1034cd754efad6ac25f06a6","observation_id":"432ca3fd-3f46-45a3-af64-f4439bd51c12","resolution":{"observed_at":"2026-08-15T15:05:20.166930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05849","last_updated":"2025-08-25T05:25:26Z","snapshot_observed_at":"2026-08-12T22:28:22.934748Z","submitted_at":"2024-10-08T09:35:37Z","title":"ModalPrompt: Towards Efficient Multimodal Continual Instruction Tuning with Dual-Modality Guided Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05849","snapshot_observed_at":"2026-08-15T15:05:19.404199Z","title":"arXiv 2024 arXiv:2410.05849","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.404199Z"},"links":{"cited_paper":"/paper/2410.05849","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:4a066712a0f1c17d7646c8f97c6bc621da2302b2833e2c1f1087d6205f4eea23","observation_id":"fa74df9c-2c29-4388-9cff-676c57337ada","resolution":{"observed_at":"2026-08-15T15:05:19.404199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.04200","last_updated":"2017-06-12T19:57:42Z","snapshot_observed_at":"2026-08-14T21:12:14.237470Z","submitted_at":"2017-03-13T00:02:48Z","title":"Continual Learning Through Synaptic Intelligence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.04200","snapshot_observed_at":"2026-08-15T15:05:19.408318Z","title":"ICML 2017 arXiv:1703.04200","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.408318Z"},"links":{"cited_paper":"/paper/1703.04200","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:d39ce7bffc8caa2d1c2fac9e602e744cdb13449ba4c953d4f4ccaf29c513332f","observation_id":"60142902-c718-4bed-89aa-85923076d2af","resolution":{"observed_at":"2026-08-15T15:05:19.408318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10313","last_updated":"2023-12-05T08:59:33Z","snapshot_observed_at":"2026-08-13T14:29:50.623753Z","submitted_at":"2023-09-19T04:51:13Z","title":"Investigating the Catastrophic Forgetting in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10313","snapshot_observed_at":"2026-08-15T15:05:19.412336Z","title":"arXiv 2023 arXiv:2309.10313","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.412336Z"},"links":{"cited_paper":"/paper/2309.10313","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:03e6b54576b79294e9e102ce2384c1a1b4e69bdcdcb0ad219b32e9df1f9783da","observation_id":"1fad8f4e-abe5-4a29-baa7-dd47759b8519","resolution":{"observed_at":"2026-08-15T15:05:19.412336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13670","last_updated":"2023-02-01T08:38:14Z","snapshot_observed_at":"2026-08-13T12:54:18.795571Z","submitted_at":"2023-01-31T14:40:05Z","title":"What Makes Good Examples for Visual In-Context Learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13670","snapshot_observed_at":"2026-08-15T15:05:19.416727Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.416727Z"},"links":{"cited_paper":"/paper/2301.13670","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:7234c545966428368b79acf800fc0d254d6c9f90ac51a0ca1cffb3e164372a79","observation_id":"f7107f3b-8393-4377-8b80-5e22068c8aeb","resolution":{"observed_at":"2026-08-15T15:05:19.416727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12048","last_updated":"2024-02-19T11:02:05Z","snapshot_observed_at":"2026-08-14T21:57:59.145824Z","submitted_at":"2024-02-19T11:02:05Z","title":"Model Tailor: Mitigating Catastrophic Forgetting in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12048","snapshot_observed_at":"2026-08-15T15:05:19.421206Z","title":"ICML 2024 arXiv:2402.12048","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.421206Z"},"links":{"cited_paper":"/paper/2402.12048","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:d9f737bcaf3adb9e13dd501aad2f7a14c02fcbb614fb723918e525fae47f26e0","observation_id":"d6fceeff-5317-41b8-a511-74d77b603445","resolution":{"observed_at":"2026-08-15T15:05:19.421206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:05:20.148889Z","title":"In: International Conference on Learning Representations (ICLR) 46","venue":null,"work_id":"8c42e4ae-0ff6-4efe-97df-bae075af2051","year":2025},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.425102Z"},"links":{"citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:02d945cfa9d4c35610e17888c8f6bb2f0717e4fa8f2d636dd96011fff05ad2d7","observation_id":"1cdba336-9c2b-4911-8a76-217d3b4bc1ff","resolution":{"observed_at":"2026-08-15T15:05:20.153010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T17:05:29.091571Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":2,"verified_fuzzy":8},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2608.02830."}