{"as_of":"2026-08-10T20:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:64e230a80fa2b199b54d610354f605f7d075e3b20d16a8ca271a59d28f9bc162","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:11:35.513418Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T07:23:19.428348Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T06:36:43.892355Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"cited_work":{"arxiv_id":"2505.19812","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19812","snapshot_observed_at":"2026-07-02T06:36:43.892355Z","title":"Efficient multi- modal long context learning for training-free adaptation","venue":null,"work_id":"ebdef462-147b-4e3c-ad37-7ae187cb134a","year":null},"citing_paper":{"arxiv_id":"2606.04434","last_updated":"2026-06-03T04:32:09Z","snapshot_observed_at":"2026-08-07T12:27:51.071256Z","submitted_at":"2026-06-03T04:32:09Z","title":"Hyper-ICL: Attention Calibration with Hyperbolic Anchor Distillation for Multimodal In-Context Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T07:23:19.428348Z"},"links":{"cited_paper":"/paper/2505.19812","citing_paper":"/paper/2606.04434"},"observation_digest":"sha256:688b8896f6219cc382441b94f97bccf602d32a1da322446f16c62fa955e605a1","observation_id":"cd89840e-8c0f-42d1-ae9c-b9b74dc55f22","resolution":{"observed_at":"2026-07-02T06:36:43.893801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19812/citation-record","integrity":"/paper/2505.19812/integrity","json":"/paper/2505.19812/citation-record.json","paper":"/paper/2505.19812"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.11018","last_updated":"2024-10-17T17:45:09Z","snapshot_observed_at":"2026-07-06T18:01:18.745347Z","submitted_at":"2024-04-17T02:49:26Z","title":"Many-Shot In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11018","snapshot_observed_at":"2026-08-07T14:11:32.304232Z","title":"M., Bohnet, B., Chan, S., Anand, A., Abbas, Z., Nova, A., Co-Reyes, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:32.304232Z"},"links":{"cited_paper":"/paper/2404.11018","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:08327594d742779ae4176e498d4f9b287038ccd22a9319b2fd247e0cbd5bddff","observation_id":"6c929e86-9daa-4a0a-ae4e-f983f0075e83","resolution":{"observed_at":"2026-08-07T14:11:32.304232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:37.625737Z","title":"Flamingo : A visual language model for few-shot learning","venue":null,"work_id":"b615ed8b-e001-41e7-baef-95182987ec74","year":2022},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:32.344644Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:0968a39ac0cc707707c6afc394b90be466769e04bd2a9c6a3016c315801d0ffc","observation_id":"7593ca6e-b579-4dcc-81f8-f9092f82acbf","resolution":{"observed_at":"2026-08-07T14:11:37.660562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T14:11:32.427273Z","title":"Qwen-VL : A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:32.427273Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:776ad631172c88f54a7a2343d293d17a9973fa85ccd0a98d985455380149faf4","observation_id":"ef4c7895-a837-44e8-866d-182a5d776de0","resolution":{"observed_at":"2026-08-07T14:11:32.427273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00200","last_updated":"2025-03-03T19:53:28Z","snapshot_observed_at":"2026-08-04T16:59:22.807968Z","submitted_at":"2024-04-30T21:06:52Z","title":"In-Context Learning with Long-Context Models: An In-Depth Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00200","snapshot_observed_at":"2026-08-07T14:11:32.503441Z","title":"R., and Neubig, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:32.503441Z"},"links":{"cited_paper":"/paper/2405.00200","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:d34c3b6cbf669d63a549ffafcbf201cad26110cdaadc062dd5717f165fa3ae24","observation_id":"74436313-c209-4d5f-80ea-8c01ac2c68fc","resolution":{"observed_at":"2026-08-07T14:11:32.503441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:37.519162Z","title":null,"venue":null,"work_id":"2e9db520-c4d3-4edf-a1e1-685604e8386e","year":2020},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:32.585907Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:03c1d2f5a3d697826108bdc22938292d92acecc412d5102a0f39474a691976b0","observation_id":"34c7919d-a2ca-4cf7-af04-7fcd4afbe359","resolution":{"observed_at":"2026-08-07T14:11:37.567201Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-07T14:11:32.665501Z","title":"Pyramidkv: Dynamic kv cache compression based on pyramidal information funneling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:32.665501Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:cf28479ebbdaba7ecc163278adf8135adc94fc029146b696445151962ed90cd8","observation_id":"67e192e5-0c0f-4ed9-8f34-2a263735c92e","resolution":{"observed_at":"2026-08-07T14:11:32.665501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20092","last_updated":"2024-11-17T17:05:03Z","snapshot_observed_at":"2026-08-10T17:11:46.055816Z","submitted_at":"2024-06-28T17:57:14Z","title":"Efficient Large Multi-modal Models via Visual Context Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20092","snapshot_observed_at":"2026-08-07T14:11:32.736571Z","title":"Llavolta: Efficient multi-modal models via stage-wise visual context compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:32.736571Z"},"links":{"cited_paper":"/paper/2406.20092","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:aa347786565226e9280513411c0f4dbc9926261adfbd06f342e205bc6a7b9728","observation_id":"2167d069-857a-41eb-9072-65fe975ff2e5","resolution":{"observed_at":"2026-08-07T14:11:32.736571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-07T14:11:32.854096Z","title":"Shikra : Unleashing multimodal LLM's referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:32.854096Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:6e6f0909a7088bffd5dcc2f76fa13dad438396eb4703f1c7152aa1bfd0429493","observation_id":"7bc0f75e-6125-493f-8c57-10d178b0b7b9","resolution":{"observed_at":"2026-08-07T14:11:32.854096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:37.294863Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"fbb3601c-ad40-457e-94e9-1318a60ab2c0","year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:32.943225Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:6d4faf5546eba1931e902536e0c3db92c0e0c10ea6419df6d8151b93a058b556","observation_id":"860b85bd-4838-41f7-99ef-2752919474db","resolution":{"observed_at":"2026-08-07T14:11:37.423877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T14:11:33.035519Z","title":"How far are we to GPT-4V ? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:33.035519Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:a8fa7aae453233479f5eb088c1553eaf09728b6d7423a271f19284f9c92f032d","observation_id":"0b8b3a9a-4426-43dc-8af1-703943d46d37","resolution":{"observed_at":"2026-08-07T14:11:33.035519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-08T03:28:12.161766Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10935","snapshot_observed_at":"2026-08-07T14:11:33.134085Z","title":"Seeclick: Harnessing gui grounding for advanced visual gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:33.134085Z"},"links":{"cited_paper":"/paper/2401.10935","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:2d0176615f7f475c6c4f48ea3a421e6ca243906fab51060d84d3d539257f2f82","observation_id":"643dfc05-6154-42ff-b97c-a625472b495f","resolution":{"observed_at":"2026-08-07T14:11:33.134085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:33.219466Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:33.219466Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:fc045288bcfe1312781553564e5cb01738b7ca2800fdf8a0c8bad1311f8df30b","observation_id":"15528579-1929-409d-acd8-fd534cf5f0cf","resolution":{"observed_at":"2026-08-07T14:11:33.219466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06512","last_updated":"2024-04-09T17:59:32Z","snapshot_observed_at":"2026-08-06T19:00:20.787763Z","submitted_at":"2024-04-09T17:59:32Z","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06512","snapshot_observed_at":"2026-08-07T14:11:33.331132Z","title":"Internlm-xcomposer2-4khd: A pioneering large vision-language model handling resolutions from 336 pixels to 4k hd","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:33.331132Z"},"links":{"cited_paper":"/paper/2404.06512","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:6f522de9931c2a1629c0cce2951da8dc71309a8df6b8d5ebbd9cbdf63845ecdd","observation_id":"e1975f8b-7e2c-40f8-b5cf-d91c1e6c1c2e","resolution":{"observed_at":"2026-08-07T14:11:33.331132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-07T14:11:33.409925Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:33.409925Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:b545702e0ae181c013c8b42f4267328c2715d457c19b7a5f051438f16782d883","observation_id":"67dc8539-a0cb-4d7a-90c9-6d742bf8a407","resolution":{"observed_at":"2026-08-07T14:11:33.409925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:37.210379Z","title":"E2vpt: An effective and efficient approach for visual prompt tuning","venue":null,"work_id":"2bd342ad-221e-4520-998a-83e97c33c1a8","year":2023},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:33.483567Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:0c020038cda6f4344b2c12dd2fc1bd45141750b70b83b3caf5d70546089b0bb0","observation_id":"c1299413-da39-438a-bf0e-0c18d0dc8edd","resolution":{"observed_at":"2026-08-07T14:11:37.241367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12902","last_updated":"2024-01-23T16:48:18Z","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T16:48:18Z","title":"Facing the Elephant in the Room: Visual Prompt Tuning or Full Finetuning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12902","snapshot_observed_at":"2026-08-07T14:11:33.554951Z","title":"Facing the elephant in the room: Visual prompt tuning or full finetuning? arXiv preprint arXiv:2401.12902, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:33.554951Z"},"links":{"cited_paper":"/paper/2401.12902","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:efb4ee7b3ac6a06d3b4690d834dbbdd6206e9a57732838a2b7669cb6edf8d567","observation_id":"0ec7e0b0-a40f-4510-b9a3-2b647d61eced","resolution":{"observed_at":"2026-08-07T14:11:33.554951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07424","last_updated":"2024-02-25T08:10:18Z","snapshot_observed_at":"2026-07-06T17:00:33.386675Z","submitted_at":"2023-12-12T16:48:07Z","title":"How Well Does GPT-4V(ision) Adapt to Distribution Shifts? A Preliminary Investigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07424","snapshot_observed_at":"2026-08-07T14:11:33.627203Z","title":"How well does gpt-4v (ision) adapt to distribution shifts? a preliminary investigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:33.627203Z"},"links":{"cited_paper":"/paper/2312.07424","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:8d35c6e52639cb145ab3faaec257385d1036a673c4a753026c3704208d0d0d70","observation_id":"3c152c7e-5fd1-4c63-ba77-0bcba38ae54c","resolution":{"observed_at":"2026-08-07T14:11:33.627203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-07T14:11:33.707321Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:33.707321Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:489285998f0c27830abb3f6900ff30d705a0928d68bc1ebd10fce6669a8efddb","observation_id":"d2d172a6-b150-4e43-a188-e8811223a222","resolution":{"observed_at":"2026-08-07T14:11:33.707321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:33.763272Z","title":"J., yelong shen, Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:33.763272Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:704ff02c6240a382bd8e39509c2602f9e72a2e3e07aa4b644b93aed92942b981","observation_id":"a97cbb4a-0e38-412c-8503-cfe33ccabf46","resolution":{"observed_at":"2026-08-07T14:11:33.763272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-07T14:11:33.828506Z","title":"MiniCPM : Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:33.828506Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:5303b07a9cc988769cc36b3c61ebda8f16a3a323ad0f77d8e95823f644c1b742","observation_id":"519e0c92-c527-4f64-b436-a095b9845eb7","resolution":{"observed_at":"2026-08-07T14:11:33.828506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:37.124845Z","title":"Multimodal task vectors enable many-shot multimodal in-context learning","venue":null,"work_id":"0e5f3269-feda-4bbe-b2dd-39ef251f70c1","year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:33.910662Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:5d272407f27ed542e0fe45cca4e2b51c4e64d4813c5e61322ae53e9143c8c06d","observation_id":"6c479d0e-d8d5-402a-9232-e27a2d20978e","resolution":{"observed_at":"2026-08-07T14:11:37.171478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:37.007795Z","title":"K., Patra, B., et al","venue":null,"work_id":"4eacc78c-14fd-43c2-a3ed-500c88db5114","year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:33.954634Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:fb0ece22e492a3de679446ebec4260d86cbc391baea5f6c371cebad248ed9b78","observation_id":"2418698b-fb25-4137-a8ad-8379cf3a1a2a","resolution":{"observed_at":"2026-08-07T14:11:37.072222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:34.015730Z","title":"Visual prompt tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:34.015730Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:02c1e595996306cc046e43928026eb1c8c5c67fad93f7343dbfa50fb7d9f32f7","observation_id":"babc7053-0aa1-404c-9f40-dea4a049286d","resolution":{"observed_at":"2026-08-07T14:11:34.015730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:36.890163Z","title":"A., Wang, J","venue":null,"work_id":"8a9d0063-2185-43e4-913f-873e6c1374d6","year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:34.109443Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:65bb951f3c9902552f95dc5518ab705ca7407e53a6ac96ed1c3273252d2fb094","observation_id":"bb0a9261-7215-4c54-943f-05f6d289123c","resolution":{"observed_at":"2026-08-07T14:11:36.940675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04931","last_updated":"2023-02-09T20:53:12Z","snapshot_observed_at":"2026-07-06T14:50:14.766783Z","submitted_at":"2023-02-09T20:53:12Z","title":"In-Context Learning with Many Demonstration Examples","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04931","snapshot_observed_at":"2026-08-07T14:11:34.160389Z","title":"In-context learning with many demonstration examples","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:34.160389Z"},"links":{"cited_paper":"/paper/2302.04931","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:556cf2fa6c5f0935c074a43b953ae1bfdc0176d484907e33b1b2f98bf507ca96","observation_id":"23bc6067-5560-47dc-8812-daeea5d49daa","resolution":{"observed_at":"2026-08-07T14:11:34.160389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-07T22:57:56.263839Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-07T14:11:34.233628Z","title":"Snapkv: Llm knows what you are looking for before generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:34.233628Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:00664b569b6177d5ee63aac5e95390ce4c442de7389d303920dc60f117abbdf7","observation_id":"a00b5135-1371-4ce3-bbb3-dd0acbe987e5","resolution":{"observed_at":"2026-08-07T14:11:34.233628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:36.804962Z","title":null,"venue":null,"work_id":"c55fb87f-3856-4858-bb0a-47f0efed405e","year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:34.287038Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:f5b9ac9bbc262b90157d3d0488f75edd7741f2edbb4477ff6e2cd736a3b3bce6","observation_id":"f9bb4932-1b06-4bd8-b864-9d21e6b712bf","resolution":{"observed_at":"2026-08-07T14:11:36.840451Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-07T14:11:34.352277Z","title":"DeepSeek-VL : Towards real-world vision-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:34.352277Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:f0f6eedd02c13527344fbfacf97e189c3dc1a6e47700f5a3cb01a7a0dc7bde10","observation_id":"1d887552-a737-4a45-baac-c887b14432db","resolution":{"observed_at":"2026-08-07T14:11:34.352277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:36.709105Z","title":"K., and Buehler, M","venue":null,"work_id":"b73d136b-7c15-428f-8cad-b8a52cda90f9","year":2025},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:34.398078Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:b90fe91549e6477fe8d06bfa4d354e76e10f06ddfb8f50e634618708175bebbb","observation_id":"a8e3e0eb-4a9f-4b9a-84f1-c5ae5072c6a1","resolution":{"observed_at":"2026-08-07T14:11:36.761632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:34.467761Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:34.467761Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:ed10fa4a90c79482cb1b23028ce1bb6f2024cfc5596129283a66aea16a7bc84b","observation_id":"0318de08-c0f8-4412-9937-4342799fd6f7","resolution":{"observed_at":"2026-08-07T14:11:34.467761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-07T14:11:34.518914Z","title":"Kosmos-2 : Grounding multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:34.518914Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:8012b3bf46d371bb7b779a7f3acec701eb5bd1778fe73210bfc95cec73fcc081","observation_id":"6a77dcc2-de59-46ea-b7dd-68f6fba2315f","resolution":{"observed_at":"2026-08-07T14:11:34.518914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:36.580168Z","title":"S., Sayeed, K","venue":null,"work_id":"d999970c-4b26-4f2c-81dd-a5e0d96103df","year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:34.552988Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:0ceaeeb90bd75b9bc91fe7566aa2523ce0869463ae900b09116782b685b0a24b","observation_id":"97260de0-4913-4b9e-9525-16a8bd43c526","resolution":{"observed_at":"2026-08-07T14:11:36.610526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:36.501537Z","title":"Locllm: Exploiting generalizable human keypoint localization via large language model","venue":null,"work_id":"3847bbb7-97db-451f-a1b6-5aed61ac2cda","year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:34.581357Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:0f7140845dc35c3bde13c9b6dc7b341647c7f50999acbd9ad6353bdc3ece5ac7","observation_id":"e63ac90b-c753-42c1-9c9e-ef41c2101dea","resolution":{"observed_at":"2026-08-07T14:11:36.533295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T14:11:34.642345Z","title":"Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:34.642345Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:283cf37f59cf891901f900b1907c3b72fb962800cb5bb790011e08a094eb0a2b","observation_id":"e3704243-3f69-43bc-9b09-978e6aca2fee","resolution":{"observed_at":"2026-08-07T14:11:34.642345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:36.369187Z","title":"M2pt: Multimodal prompt tuning for zero-shot instruction learning","venue":null,"work_id":"1374714d-4574-4ad9-ae79-775a72964c1f","year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:34.698886Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:f6bb45f120521ff5121e9129fda649011b69935d36cf637ee4e24ab1b2228f8e","observation_id":"11826797-261a-40f2-b98f-66a8f21e0a04","resolution":{"observed_at":"2026-08-07T14:11:36.408293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-07T14:11:34.762926Z","title":"CogVLM : Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:34.762926Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:da0b65769119baaafae88e525c20d2413f8f639f728cadcd497188cdc82cf462","observation_id":"6e0f3a88-6f01-436d-83d3-2e7ed9ae359b","resolution":{"observed_at":"2026-08-07T14:11:34.762926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:34.819044Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:34.819044Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:1d576e9f2ff1426bddcd48333a9adf6af708a529e79cd670f02bb2d8b19522e9","observation_id":"6820257a-da9a-4614-8419-f4f9f994887d","resolution":{"observed_at":"2026-08-07T14:11:34.819044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:36.275317Z","title":"Pink: Unveiling the power of referential comprehension for multi-modal llms","venue":null,"work_id":"77921296-a21c-4dd6-b9c4-37e96f438c8c","year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:34.872853Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:967c30f7648b9801e9440d22ab43299670413a376a1a4970bc360a0be0f3de44","observation_id":"ebd177b5-26e7-4f03-8e4f-73a59f334cf0","resolution":{"observed_at":"2026-08-07T14:11:36.347206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:36.172224Z","title":"Pyramidinfer: Pyramid kv cache compression for high-throughput llm inference","venue":null,"work_id":"2c403714-183c-4ab9-8c5f-00e107b7c78b","year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:34.919982Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:f11278c1122e7d3d0a2c834e6e5cd6875ee75f4020bc1c050fc44ff629612430","observation_id":"362d4ae8-9baa-4683-894e-d66714b5ba9a","resolution":{"observed_at":"2026-08-07T14:11:36.194550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-07T14:11:34.997434Z","title":"Yi: Open Foundation Models by 01.AI","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:34.997434Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:7780d5653a436faa405a149e1e80e6ef96a0f0eda1afd7518ddae7728e15098d","observation_id":"79afe392-d574-4bc9-af5a-75d37f59269f","resolution":{"observed_at":"2026-08-07T14:11:34.997434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-07T14:11:35.075180Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual input and output","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:35.075180Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:829462d1f9c0ef9354ff0a712328f5eff20bbffe5dc5b12b1d06066bf292c812","observation_id":"2f7a8c52-13f7-49be-926a-c10ac801f6d5","resolution":{"observed_at":"2026-08-07T14:11:35.075180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06599","last_updated":"2024-02-09T18:21:51Z","snapshot_observed_at":"2026-07-06T17:28:06.332906Z","submitted_at":"2024-02-09T18:21:51Z","title":"On the Out-Of-Distribution Generalization of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06599","snapshot_observed_at":"2026-08-07T14:11:35.156013Z","title":"On the out-of-distribution generalization of multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:35.156013Z"},"links":{"cited_paper":"/paper/2402.06599","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:98e4d6c540db15d95c4be65c894575d279650f27d42c49850fc3419d67e7217c","observation_id":"5e26cdee-dfc5-4d36-bf20-3a7f973e4bd1","resolution":{"observed_at":"2026-08-07T14:11:35.156013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13257","snapshot_observed_at":"2026-08-07T14:11:35.208090Z","title":"Mme-realworld: Could your multimodal llm challenge high-resolution real-world scenarios that are difficult for humans? arXiv preprint arXiv:2408.13257, 2024 c","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:35.208090Z"},"links":{"cited_paper":"/paper/2408.13257","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:785897f21a82c35c663eab79914078dcfec5e43d09823763ece75f76d55cf3cf","observation_id":"6f215e4e-184c-4263-8b20-3192cfbb75cc","resolution":{"observed_at":"2026-08-07T14:11:35.208090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:35.267520Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:35.267520Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:3b19cf0622eb668d35d0e792eda3d83f5bdfcf5958cabebba7b50d772c860232","observation_id":"2b06defb-91f6-4e98-b706-31b9ce580a2d","resolution":{"observed_at":"2026-08-07T14:11:35.267520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:35.972581Z","title":"Towards automatic learning of procedures from web instructional videos","venue":null,"work_id":"0d58af96-b054-4fce-a4cb-7702e71df7b6","year":2018},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:35.326708Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:05f6b58d69bab64c32db8e10a9cee56394456ef1e162a1681c64e646ef5f675b","observation_id":"8ff75235-870d-43e0-aa6b-fe336c89a79f","resolution":{"observed_at":"2026-08-07T14:11:36.089663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T14:11:35.385052Z","title":"MiniGPT-4 : Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:35.385052Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:53fbdf9f299f3523d18f75761b324408c1da3869cb0bcb31940622c6aee298e6","observation_id":"f215767b-ef12-4d92-b20f-2bd45afa47d4","resolution":{"observed_at":"2026-08-07T14:11:35.385052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:35.762927Z","title":"Mini GPT -4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":"d9275838-7a22-434a-9e29-a6092b4b0891","year":2024},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:35.454571Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:3593498fb7fb52f461dd3c98e5dfba11ad9d521de4eeb1a37b74ce0ed9517364","observation_id":"023b0629-f762-439d-8158-f004e14b5aad","resolution":{"observed_at":"2026-08-07T14:11:35.849194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:35.513418Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T14:11:35.513418Z"},"links":{"citing_paper":"/paper/2505.19812"},"observation_digest":"sha256:89174f0be314e75caf3c6ea7f01d7ecfc17a1026670765de1ea6491526b7fb1c","observation_id":"82575eb0-9963-44bb-be2d-ef1d287bce29","resolution":{"observed_at":"2026-08-07T14:11:35.513418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19812","last_updated":"2025-05-26T10:49:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:03:35.738779Z","submitted_at":"2025-05-26T10:49:44Z","title":"Efficient Multi-modal Long Context Learning for Training-free Adaptation"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 1 inbound Pith citation observation for arXiv:2505.19812."}