{"as_of":"2026-08-20T10:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:515a0df5ae7e9a3b2c9f0486c65d1d8aec300091ae08c60b1fe3e217bb4cb806","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T12:47:40.536347Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T15:03:42.749059Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"cited_work":{"arxiv_id":"2605.31513","doi":"10.48550/arxiv.2605.31513","metadata_source":"pith","pith_arxiv_id":"2605.31513","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","venue":"cs.CV","work_id":"2d0b5f23-635b-4242-b632-8003bbd460f2","year":2026},"citing_paper":{"arxiv_id":"2607.21635","last_updated":"2026-07-20T23:14:36Z","snapshot_observed_at":"2026-08-12T14:19:31.472875Z","submitted_at":"2026-07-20T23:14:36Z","title":"Toward User-Conditioned Evaluation of Personal LLM Agents under Temporal Interventions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T15:03:42.749059Z"},"links":{"cited_paper":"/paper/2605.31513","citing_paper":"/paper/2607.21635"},"observation_digest":"sha256:608299a37050eb7d3d3eaa35b0768607ceaf7e940c68d77f89a41bf4b84af600","observation_id":"296ee6f0-30cc-4ecb-9998-6b993ec80e1c","resolution":{"observed_at":"2026-08-01T15:08:40.077245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.31513","snapshot_observed_at":"2026-08-01T06:14:10.552124Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21973","last_updated":"2026-07-24T04:39:55Z","snapshot_observed_at":"2026-08-13T18:22:50.816857Z","submitted_at":"2026-07-24T04:39:55Z","title":"Rethinking Layer-Wise Information Allocation for Vision Foundation Model Adaptation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T06:14:10.552124Z"},"links":{"cited_paper":"/paper/2605.31513","citing_paper":"/paper/2607.21973"},"observation_digest":"sha256:c06d603240412fa87745a77e249175e467aa26ddd18e87a569f852041ba7f9c6","observation_id":"695504e7-ece9-4c64-afa8-6dfe625e6aec","resolution":{"observed_at":"2026-08-01T06:14:10.552124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.31513/citation-record","integrity":"/paper/2605.31513/integrity","json":"/paper/2605.31513/citation-record.json","paper":"/paper/2605.31513"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:36.520388Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:36.520388Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:93a204a9d9de2ccfc8ae5eca444df75b0939b00e325ec78e69fdb5bc7dd93205","observation_id":"83fbc121-c457-4e69-b309-5a4c7fa801b9","resolution":{"observed_at":"2026-08-02T12:47:36.520388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:36.655289Z","title":"arXiv preprint arXiv:2411.11706 (2024) 2, 4, 11, 17, 20, 21","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:36.655289Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:8422b78f9136128f756175ffec946454d363626299b42379fb7ee3ae107b209b","observation_id":"1842b220-638e-44af-9283-651b8918536d","resolution":{"observed_at":"2026-08-02T12:47:36.655289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:36.775085Z","title":"arXiv preprint arXiv:2505.14671 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:36.775085Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:c10d55bdf12bbe42f379275ade4de4267ada4f47e03ba6427915312fd9b69546","observation_id":"943ece8b-3926-4920-a7b2-78e5a792dfee","resolution":{"observed_at":"2026-08-02T12:47:36.775085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:36.886507Z","title":"In: Synthetic Data for Computer Vision Workshop@ CVPR 2025 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:36.886507Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:60c728775d5fee293105bcaeef13d781b8c38f19ddbbbe863c5aeac891a4c8de","observation_id":"29dc6038-cd83-4617-9a26-10e64c89c1a8","resolution":{"observed_at":"2026-08-02T12:47:36.886507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T12:47:36.993999Z","title":"arXiv preprint arXiv:2511.21631 (2025) 4, 11","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:36.993999Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:c99b5ad2bbb7eae63c9c1ae9e02cb4c2e66e2a141168a3aa93e744a92bab2abc","observation_id":"329e5ac4-8c1b-4431-b20b-1248da7197d7","resolution":{"observed_at":"2026-08-02T12:47:36.993999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08640","last_updated":"2023-06-28T05:00:35Z","snapshot_observed_at":"2026-08-16T15:23:54.330945Z","submitted_at":"2023-06-14T17:12:56Z","title":"AssistGPT: A General Multi-modal Assistant that can Plan, Execute, Inspect, and Learn","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08640","snapshot_observed_at":"2026-08-02T12:47:37.161446Z","title":"arXiv preprint arXiv:2306.08640 (2023) 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:37.161446Z"},"links":{"cited_paper":"/paper/2306.08640","citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:cfa5168ab6e634bd311910371d7d3aafb2503b81d24f37bb97f426b0b57d688f","observation_id":"34492b33-da7b-44a1-a518-10a89893e27e","resolution":{"observed_at":"2026-08-02T12:47:37.161446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:37.277573Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:37.277573Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:db3ffa643355df34889046b918d5413088768dea48ea062abaf254efc2fb1d0c","observation_id":"2cc0f3b2-0138-4577-b00d-49e8d73c2d16","resolution":{"observed_at":"2026-08-02T12:47:37.277573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09543","last_updated":"2023-03-24T09:17:17Z","snapshot_observed_at":"2026-08-16T03:03:21.512563Z","submitted_at":"2021-11-18T06:48:00Z","title":"DeBERTaV3: Improving DeBERTa using ELECTRA-Style Pre-Training with Gradient-Disentangled Embedding Sharing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09543","snapshot_observed_at":"2026-08-02T12:47:37.404653Z","title":"arXiv preprint arXiv:2111.09543 (2021) 12","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:37.404653Z"},"links":{"cited_paper":"/paper/2111.09543","citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:6bcb05d02518deb3c32c79bd2bd4b68176129879febfb146fbb522be582fe7e8","observation_id":"0575b3d7-0d8d-4d27-917f-67125c63db7f","resolution":{"observed_at":"2026-08-02T12:47:37.404653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:37.509426Z","title":"arXiv preprint arXiv:2509.22820 (2025) 4, 10, 19","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:37.509426Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:8658c0a167caeddcfe3bec982e28981c1e3396599c0dcd1e2fbb61cf38087eb3","observation_id":"36f48249-71a2-4d9b-a68c-00c99d5c7d75","resolution":{"observed_at":"2026-08-02T12:47:37.509426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:37.617189Z","title":"arXiv preprint arXiv:2509.21730 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:37.617189Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:fd8fe437318303491bc5d1a3968c66fc15981435719cc7389dcc4374a3664efa","observation_id":"3f480db5-6515-4742-b715-0fd52f380e6f","resolution":{"observed_at":"2026-08-02T12:47:37.617189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:37.775516Z","title":"International Journal of Human–Computer Interaction pp","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:37.775516Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:cad32cc773d5b53bf3a6c1051a9d63825569a2c62a1d976348a5ad5e5e310cce","observation_id":"e3cc2c9d-bcde-4161-94d1-4408829d5473","resolution":{"observed_at":"2026-08-02T12:47:37.775516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:37.913357Z","title":"In: Second Conference on Language Modeling (2025), https://openreview.net/forum?id=9ffYcEiNw92","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:37.913357Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:61f0b1f4edd27b2a599b83a69b35db82bbf630cd388cbc8b28ef390475636c82","observation_id":"bcd8e390-f2f7-49c5-be74-c9a4535acbb4","resolution":{"observed_at":"2026-08-02T12:47:37.913357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:37.999067Z","title":"In: Pro- ceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:37.999067Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:036756161a1e81ccf86853ecaead5a103f2bf7468024f7f2e668b652ab785db7","observation_id":"da2a678f-9feb-4bd2-94cf-3ea2a31d0d90","resolution":{"observed_at":"2026-08-02T12:47:37.999067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:38.196821Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:38.196821Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:3c6e0fd43fff99dcf68370fc701e0513f223bc7cec891acb2c0e31f7c45e6400","observation_id":"2342b135-a22d-4dfe-b75c-1465680daae1","resolution":{"observed_at":"2026-08-02T12:47:38.196821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:38.395852Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:38.395852Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:6d400329775061b51584841d74defe0911c580fc6a05602f4dcb00a488e589fa","observation_id":"06107ee2-0491-4c06-9f02-dbb320144e65","resolution":{"observed_at":"2026-08-02T12:47:38.395852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:38.585981Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:38.585981Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:946325b5d83247a0150674e5384fcec253f46c56dc9422bd5d0b537fc4672b96","observation_id":"1164d86a-a955-4564-b1df-43b78ace8c9d","resolution":{"observed_at":"2026-08-02T12:47:38.585981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:38.717642Z","title":"Advances in neural information processing systems36, 34892–34916 (2023) 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:38.717642Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:b3ab1f542b22181cc95dbad96c9e2a420d32ad382075522af3fbdc58c632c6fb","observation_id":"2ac4cdcd-65b4-459f-a6cb-181b177f4b51","resolution":{"observed_at":"2026-08-02T12:47:38.717642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:38.852651Z","title":"In: Findings of the Association for Computational Linguistics: NAACL 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:38.852651Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:7966e114e7cef45051b765ac204c6d7fb8c459b8baa077ea6b3c314115fbfa19","observation_id":"1350c65b-38dd-48da-b75a-f5827a96d272","resolution":{"observed_at":"2026-08-02T12:47:38.852651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:39.049525Z","title":"Ad- vances in Neural Information Processing Systems37, 23464–23487 (2024) 6","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:39.049525Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:a217426cd3be207c72cef42800ea54ef6eb2bd88cbbbbc6f0ac313a03c3b190f","observation_id":"625ca757-be3c-4654-9052-e059972c1d62","resolution":{"observed_at":"2026-08-02T12:47:39.049525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:39.175810Z","title":"Advances in Neural Information Processing Systems 37, 40913–40951 (2024) 2, 4, 11, 17, 20","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:39.175810Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:d5a5f410c3a7d5d8deaa882ef4f96921b7e07e3933c5c41ddd6609995c46c00b","observation_id":"0bd730db-8aa9-43fa-9f53-7f08bcd2b421","resolution":{"observed_at":"2026-08-02T12:47:39.175810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-02T12:47:39.376458Z","title":"arXiv preprint arXiv:2304.07193 (2023) 22","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:39.376458Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:3c9e891cffee7d7abb4c476d5f6eeced1bf296d419a60789e58f84ffe458d3fc","observation_id":"9da38697-2c51-46a4-8e8c-fd490ff8a76f","resolution":{"observed_at":"2026-08-02T12:47:39.376458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:39.499649Z","title":"In: Proceedings of the 2025 CHI Conference on Human Factors in Computing Systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:39.499649Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:618eb6f51f5669c2c132ceac4f9962628bce679f9b71d8c28353b1e5815274d8","observation_id":"f87c977d-7f84-4f89-aed2-14232c914a34","resolution":{"observed_at":"2026-08-02T12:47:39.499649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17610","last_updated":"2024-12-23T14:29:41Z","snapshot_observed_at":"2026-08-19T00:26:35.789182Z","submitted_at":"2024-12-23T14:29:41Z","title":"Personalized Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17610","snapshot_observed_at":"2026-08-02T12:47:39.581721Z","title":"arXiv preprint arXiv:2412.17610 (2024) 2, 4, 11, 21","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:39.581721Z"},"links":{"cited_paper":"/paper/2412.17610","citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:b448206a299e2a525503fd618edc6afe8eb4d068c0b763fce2301d96d247833a","observation_id":"d7376f13-91a7-49b9-8ec1-3b22c8774831","resolution":{"observed_at":"2026-08-02T12:47:39.581721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07113","last_updated":"2024-10-09T17:46:53Z","snapshot_observed_at":"2026-08-16T13:11:00.039638Z","submitted_at":"2024-10-09T17:46:53Z","title":"Personalized Visual Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07113","snapshot_observed_at":"2026-08-02T12:47:39.664859Z","title":"arXiv preprint arXiv:2410.07113 (2024) 2, 4, 11, 21 Abbreviated paper title 17","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:39.664859Z"},"links":{"cited_paper":"/paper/2410.07113","citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:03101bef5854ea29bbf3e8ca89f42372a41aaa12df72677fdd3881c92942e7d6","observation_id":"5be648e4-65b6-4380-bc22-9fd0f85bbb60","resolution":{"observed_at":"2026-08-02T12:47:39.664859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:39.725144Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:39.725144Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:33eaa8630989c16548de75c91c822ed5515b5eb80afd3e8ff25664dcf0c54785","observation_id":"6f005fab-c131-45fe-994c-2fcfcd1695e5","resolution":{"observed_at":"2026-08-02T12:47:39.725144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-02T12:47:39.746335Z","title":"arXiv preprint arXiv:2401.14159 (2024) 22","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:39.746335Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:2c8d03a42c579fd7f3e13f98dcbf57f4fbf4de12100276d6fb5adaa94a519180","observation_id":"f104f8f2-11c0-4cb3-a35a-e6c8a87a4823","resolution":{"observed_at":"2026-08-02T12:47:39.746335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:39.858066Z","title":"In: Proceedings of the 62nd Annual Meeting of the AssociationforComputationalLinguistics(Volume1:LongPapers).pp.7370–7392 (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:39.858066Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:b5be4391c6c3a49fe0b460a78d920949c7a9f8ef23ceb3380c292f459024cfa9","observation_id":"863b20cb-ff8f-4423-b307-0e0aa70414a9","resolution":{"observed_at":"2026-08-02T12:47:39.858066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02452","last_updated":"2026-04-28T16:36:23Z","snapshot_observed_at":"2026-08-20T08:01:55.169145Z","submitted_at":"2025-02-04T16:19:20Z","title":"Personalization Toolkit: Training Free Personalization of Large Vision Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02452","snapshot_observed_at":"2026-08-02T12:47:39.949734Z","title":"arXiv preprint arXiv:2502.02452 (2025) 11, 21","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:39.949734Z"},"links":{"cited_paper":"/paper/2502.02452","citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:21497a1f20ffd100233b274d84909dfb6833bf9770454f6dc78d15a91a3f7ded","observation_id":"0eac280e-a913-47ef-9513-222fadc4350f","resolution":{"observed_at":"2026-08-02T12:47:39.949734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-08-18T01:07:23.737664Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-02T12:47:40.025987Z","title":"arXiv preprint arXiv:2508.10104 (2025) 22","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:40.025987Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:64e880e9802373075be2d2ab0b66624bde29e5d9ccb627e363a896c18c978a8d","observation_id":"cf4f15e5-0c17-48b0-a05f-59b2dc711f2a","resolution":{"observed_at":"2026-08-02T12:47:40.025987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19897","last_updated":"2026-04-20T16:29:04Z","snapshot_observed_at":"2026-08-18T01:10:23.346857Z","submitted_at":"2025-05-26T12:27:27Z","title":"ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19897","snapshot_observed_at":"2026-08-02T12:47:40.094181Z","title":"arXiv preprint arXiv:2505.19897 (2025) 1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:40.094181Z"},"links":{"cited_paper":"/paper/2505.19897","citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:c3fb1f75660c494cd77e2f8e8555b61813a071db84c6928d2691b4814dc7f8a0","observation_id":"5a0cb136-dd63-4878-9b49-68518c3d113a","resolution":{"observed_at":"2026-08-02T12:47:40.094181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-17T12:32:16.575866Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-02T12:47:40.169240Z","title":"5: Advancing open-source multimodal models in versatility, reasoning, and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:40.169240Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:f90b2bd32420e4cadbd7cf179b058586e69ea1b2c1688f21ebc51c2820e8329a","observation_id":"2422728c-0e33-43b5-b5a2-e60cff62751a","resolution":{"observed_at":"2026-08-02T12:47:40.169240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:40.247366Z","title":"arXiv preprint arXiv:2510.22765 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:40.247366Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:936b77d95df3f4859aee3edf54b8753abf12b0e953aa3c1c71b8a5e6f1b86c9a","observation_id":"772800ba-8e6d-4aff-97a4-675fa6a168e8","resolution":{"observed_at":"2026-08-02T12:47:40.247366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:47:40.317946Z","title":"National Science Review11(12), nwae403 (2024) 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:40.317946Z"},"links":{"citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:54b8b2ef241c1914b4273b0a820eb17c2b9ce07e533124307d985d8b1c4fae78","observation_id":"3d17b088-c088-4c9d-8098-3a5933cc6f10","resolution":{"observed_at":"2026-08-02T12:47:40.317946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13601","last_updated":"2024-05-28T05:36:23Z","snapshot_observed_at":"2026-08-16T14:24:48.404762Z","submitted_at":"2024-01-24T17:10:45Z","title":"MM-LLMs: Recent Advances in MultiModal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13601","snapshot_observed_at":"2026-08-02T12:47:40.443273Z","title":"arXiv preprint arXiv:2401.13601 (2024) 1, 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:40.443273Z"},"links":{"cited_paper":"/paper/2401.13601","citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:428cd502e0c89096dad696ff085bc3d202381279c2d55b3994fa28b7f646d599","observation_id":"fdb41073-0c8b-48fc-b90a-b6731dba0930","resolution":{"observed_at":"2026-08-02T12:47:40.443273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-02T12:47:40.536347Z","title":"Can you see <sks1> in this photo? Answer with a single word: Yes or No","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T12:47:40.536347Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2605.31513"},"observation_digest":"sha256:73dd373d5cb435c30a9de8f515c172aaa90fd3e83a6bba17849e9496487ae085","observation_id":"776ed45b-a61a-452a-8785-4dbbd4aaac23","resolution":{"observed_at":"2026-08-02T12:47:40.536347Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.31513","last_updated":"2026-07-26T14:50:39Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T12:47:34.909925Z","submitted_at":"2026-05-29T16:31:25Z","title":"Personalize Your Large Vision-language Models With In-context Prompt Tuning"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 2 inbound Pith citation observations for arXiv:2605.31513."}