{"as_of":"2026-08-24T01:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af61dabb25b67b2719cc6708e4cd956030bed440b9bcc8cc52879e55e7545061","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T18:42:33.178622Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-07T19:32:20.095114Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T19:34:06.409175Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"cited_work":{"arxiv_id":"2603.24690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.24690","snapshot_observed_at":"2026-07-07T19:34:06.409175Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","venue":"cs.CV","work_id":"6624e9b9-9e22-4b9f-b4bb-72cf2d1f5517","year":2026},"citing_paper":{"arxiv_id":"2607.05290","last_updated":"2026-07-06T16:30:41Z","snapshot_observed_at":"2026-08-13T01:10:38.072736Z","submitted_at":"2026-07-06T16:30:41Z","title":"ChatImage: Navigating Long-Form LLM Answers through Interactive Images","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-07T19:32:20.095114Z"},"links":{"cited_paper":"/paper/2603.24690","citing_paper":"/paper/2607.05290"},"observation_digest":"sha256:e54eda81ffb110d7b1250cf9e436fcf2ea0e1afa80f8cc505f8f3e5e740d8cc6","observation_id":"c075f7a1-ad10-4891-9855-286a7582edd3","resolution":{"observed_at":"2026-07-07T19:34:06.411651Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.24690/citation-record","integrity":"/paper/2603.24690/integrity","json":"/paper/2603.24690/citation-record.json","paper":"/paper/2603.24690"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:7776c8a64836cd47cb218608a21d87e424141d1812c42c03fb0c152ee1167e70","observation_id":"aa471f00-4758-4517-ad3c-00dad4735a79","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models.arXiv preprint arXiv:2308.01390, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:82faacc3a694bdd354cc2dda136c67f66cbc0554bb3603dad3c811bd3fc2af66","observation_id":"aa6fcbb4-dfd2-4cef-b9fa-b121ec75b9e9","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:5e5fc4d45bb18b2410dd48c74200d8da822066d3f55b0762a8f1285702813aa7","observation_id":"9ce49761-6b9a-41eb-86da-532f94f675f2","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:14668a3f446f0bdc9e013f4f94ca8109297ea506d78bf7f8e897d63d30db8a17","observation_id":"af49630d-8532-43b9-867c-ebc8731dcfdc","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Can multimodal large language models truly perform multimodal in-context learning? In2025 IEEE/CVF Winter Conference on Applications of Computer Vision (W ACV), pages 6000–6010","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:d18d4dc263e6b5d6934168e74e3321b976616d60e468ef6c9ecab6c991bcf318","observation_id":"4e4c3c86-497f-4d38-8dde-9db7334448fd","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Levels of processing: A framework for memory research.Journal of verbal learning and verbal behavior, 1972","venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:367281b0dd3d010b8f6de01e287b060be0d11de91fac37a08bfe0b13742e1dde","observation_id":"7d7656c1-c31b-4bf7-9a25-fdb16806f88a","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-17T01:11:44.872398Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:3147663540a431774674fc56a0fa47bc24b50449a9a347699c9bb1d5ade45761","observation_id":"8b2d24ca-37a9-4fb6-aa3e-e5a509426dfb","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-20T05:11:46.926766Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Dreamllm: Synergistic multimodal comprehension and creation.arXiv preprint arXiv:2309.11499, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:d3400ac37cb583a922b0685d22c1033c606e6b8c6fc3b017d0231e952b27d0e5","observation_id":"cde3d691-1321-435b-a7c4-5c13014a06ae","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Distributed hierarchical processing in the primate cerebral cortex","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:50b47842089f89424ba46019fb1c26406fb4674c7e2f4c4754bcda5c54fb0458","observation_id":"22658d71-2463-4b6f-95a0-a2c44cdcec12","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment.Advances in Neural Information Processing Systems, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:791a0bcb490f52ab616e5dbc6454609b912fb84c1ea2db26134b9abed84c32b4","observation_id":"ea590123-6760-4a52-851c-594a4a392e70","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Processing capacity defined by relational complexity: Implications for comparative, developmental, and cognitive psychology.Behavioral and brain sciences, 1998","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:a4a4fdfd79a529f714991c01c2d70c9877c0a0d349018b4f7c22e7ec88976e74","observation_id":"175285c7-56dd-4630-b3aa-8ba9c27fa61a","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:064125b223cbc15a627211318761e98b11a6c7d0f6995e734c02d95bff3b34b2","observation_id":"9e3b0ec1-8fb0-4d8f-bc0b-86754c7b0ac4","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Glm-4.5 v and glm-4.1 v-thinking: Towards versatile multimodal reasoning with scalable reinforcement learning.arXiv preprint arXiv:2507.01006, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:ad75d4c14d097b67997dc97cf7f59ec625511c9cc61301b956fd2382f9a27e9d","observation_id":"0829e7d9-7d9b-45d9-ae28-c5f2f7dca782","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Detect anything via next point prediction, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:94989c0c67bae31bc07c42110b8f48d8076a27955a868979dad249c571128b42","observation_id":"50cf13b9-172d-4447-a5c4-71bed2421ef8","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Generating images with multimodal language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:7d2a7208fcbb265a9cf2862777b7bc90fae061803159fdf0357734464a12e215","observation_id":"cb655419-7889-4d8a-8c6b-a8cf82f86e78","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"What matters when building vision-language models?NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:32f9247a2c805f9d27de26876613c5e3607253576eb02df164126ff1deff00df","observation_id":"c4e35e50-9b82-4d56-8af8-771747724d36","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Mimic-it: Multi-modal in-context instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:2d727f3ab890a49ec5296d11896be59d339ac9b03d088e1cacfc99d6c1480917","observation_id":"97b6a8ae-8cff-4efe-98ed-4afc998a3148","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Otter: A multi-modal model with in-context instruction tuning.T-PAMI, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:4f2eab106a463d70242e92e38c03b68d7f64c3e1f484bd3d1904765e3a82cff8","observation_id":"3646c887-112f-4be0-81c2-320e1a1840ae","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension.arXiv preprint arXiv:2307.16125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:19dd679cdfd174c1ae617864215c7ddabfbff5d6fb0327846192281aa7068a38","observation_id":"550ffadb-107e-407b-b96e-bdf27594fbd8","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:9d49b2cc55400af68c52c061b477fe7ecdc4ae428adc5f5cf0dcb8571558df51","observation_id":"dc169f5e-f476-49e4-80e2-ffd041c20d23","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"M2iv: Towards efficient and fine-grained multimodal in-context learning in large vision-language models.arXiv e-prints, pages arXiv–2504,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:d301a72fe98a9fc66377f2557bf10fdd506d3e98d2f1bd234a78bab1301bfc5e","observation_id":"f23a9da6-1c21-4915-937b-c76d173fd673","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Visualcloze: A universal image generation framework via visual in-context learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:fae3f9a4dfa996804cecd238d268e85068a53516352aa32ded717d20157c5bc1","observation_id":"cf74c5d0-24db-4404-a096-300d1c350b18","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-08-12T23:49:38.644434Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Uniworld-v1: High-resolution semantic encoders for unified visual understanding and generation.arXiv preprint arXiv:2506.03147, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:252cbeeaabf5aec23254f146a19a3dea7b93db4c3369e5d34fdbbd94212e4549","observation_id":"ac02e138-4057-49c5-99f7-f192d580cac3","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Mmbench: Is your multi-modal model an all-around player? InECCV, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:263c5b43b0dc13294b089e3ca868eb50fbdcbf2c48a50fd7254c81ec8a4c6db3","observation_id":"98a085e4-e67c-4371-b71f-e5a00d8faa15","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"The flan collection: Designing data and methods for effective instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:710dc6a53a375f0acb81aef3429d962e6c8bbe56fcbb90c86813f7696460f9d4","observation_id":"1ede21f4-6e36-41cd-b56e-703fbd024205","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Fantastically ordered prompts and where to find them: Overcoming few-shot prompt order sensitivity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:7ff76498e1a11bf145a0926696fdc0541ed691d9e55dd678019c4a1aa9baa752","observation_id":"821d1b88-4924-4ece-ad05-93aad78325b6","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Hpsv3: Towards wide-spectrum human preference score","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:35960b2c444d16eb1257a7c7a81f74907de7698c34acfd3967140e524f13dc0a","observation_id":"ad177161-bbcc-4adb-bdac-f0a44642bd0e","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-08-18T21:12:50.808922Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"In-context learning and induction heads.arXiv preprint arXiv:2209.11895, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:5f5f7d32b2fa5201bc355c72d8cd4291aa7de9d885d894d81dd57f2f46c04d86","observation_id":"dd10b1a6-d4a9-4cf0-a7c0-b93cbb99a353","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"What factors affect multi-modal in-context learning? an in-depth exploration.Advances in Neural Information Processing Systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:ad8f34aa539b24deb99c85bf55350ed8a711781a4ac0499820dddcc1f6ea5358","observation_id":"bf778a14-ca72-4c44-b9ec-0122a1de2d74","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-08-14T13:38:50.524779Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Gated attention for large language models: Non-linearity, sparsity, and attention-sink-free.arXiv preprint arXiv:2505.06708, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:0b86851cb48aa6b7eac97c81844eed25280e8b231c5427c179962e95cb85e8a1","observation_id":"9f1ce7c2-8d07-4dcd-9910-bad04b5284ec","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:d2ef824cad54f251cb6af8882fbe383112745cc641ab1564fb2818de09f9fa25","observation_id":"bd889ec9-24ed-4b6b-adc3-583c5bed9414","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.NeurIPS, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:7e8a64b8a24868369f655a5d5b5dc68938260bb93779d137efdc369290b1582e","observation_id":"9a148b61-a768-420d-9ce5-8937b57faeeb","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-08-18T01:07:23.737664Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Dinov3.arXiv preprint arXiv:2508.10104, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:241a6dbb1e43684aa8615c291d99082cf3c713395dd2fa2f5d62f1bfd89bac28","observation_id":"57a8c9a8-455f-4352-bdb8-57d8ab4a7aec","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Emu: Generative pretraining in multimodality.arXiv preprint arXiv:2307.05222,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:f3c04d6341a81fb341a8510a0f42c1b393304ec0a2b26d5ffc97f7661cdffa53","observation_id":"4f99a9fe-14e3-459c-bd7e-33a2a93876ea","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:ce768391d5a33d582b912f3c887672b47537ef82cc535b1828c00c501d0148b3","observation_id":"f4cff1d0-fb9e-453f-8d6d-7aa21ac13e36","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Codi-2: In-context interleaved and interactive any-to-any generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:69efbc3c499aacd5119f281bb58e49f18831711192867fe9d63c178b0bcca46f","observation_id":"d672e8d4-fe0b-4ecb-9978-63ef903fbd5b","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Determinantal point processes for machine learning.stat, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:37b6e3261482b6d2f9368b73b0a55b353dae05fe0a2e8d37d13e04fccff25cd0","observation_id":"6619c410-9a38-4de8-8ace-5eb04f19addd","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:0c4ff3f6a21dfd2768452ca47fa0f10b6632ccd66c82324171f580800c2f9499","observation_id":"a469517b-ad58-47a2-ad05-d6706c7ae686","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Qwen2.5-vl, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:3d72ff150157617566a145e39079a9a039457d869b532d127ba2f716eece5052","observation_id":"a0c5863c-4ab9-49d5-b9e8-50aa99d2a707","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:ce79d40a3494520e2cc30918b378f78cb17f9324a4b5db07e806c4437449e95a","observation_id":"bdbf2c55-925e-46f8-8b79-6b9f46f1df32","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Ovis-u1 technical report.arXiv preprint arXiv:2506.23044, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:b38a00b68c9e924d832667ee51b6dee969f68ac2adf1da15138eb06fbad90696","observation_id":"72272e35-bc7a-4e93-98b7-74e476b2700d","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-17T12:32:16.575866Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Internvl3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:1bae4f11d143d308e62a197fc0dd2ad7061ac887db83434239db8f04976f7708","observation_id":"a3fda085-5bfd-478c-b002-20cc6cce6f78","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Emu3: Next-token prediction is all you need.arXiv preprint arXiv:2409.18869,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:e5453511384e13a10231851a6dff78a03caa578b3e6ad581237947b810baeb50","observation_id":"6383ef36-0853-428f-987d-c3f59c9dba6f","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Super-naturalinstructions: Generalization via declarative instructions on 1600+ nlp tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:59b259ed5d8ee85b575c1562edd754545cc57c70703b04ee3ef32ecb7a5a64e9","observation_id":"73c2d116-16b0-4735-81f8-8977947c9cf2","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17090","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Q-align: Teaching lmms for visual scoring via discrete text-defined levels.arXiv preprint arXiv:2312.17090, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2312.17090","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:1d96314b59842953d269cfb52ceba90b0e919c6bf43b4988e72d22cf41db5850","observation_id":"62a2d729-a2de-4553-aff2-31f78d05960f","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02080","last_updated":"2022-07-21T07:44:13Z","snapshot_observed_at":"2026-08-10T22:45:29.185791Z","submitted_at":"2021-11-03T09:12:33Z","title":"An Explanation of In-context Learning as Implicit Bayesian Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02080","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"An explanation of in-context learning as implicit bayesian inference.arXiv preprint arXiv:2111.02080, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2111.02080","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:03953adf4c5a0b4574cfac6fa766b9e5cfeb9e1e711feebc3e9ced607ff9bcdf","observation_id":"f3fd0217-5e95-4c5c-8797-377cb7c6a6dc","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:42f00729f55a2f4bba4362fbd6db3a60733657fe752239cc7dc61a6531fc1a0a","observation_id":"13d7c64c-63e9-42c8-bb53-4e2a0a1a3ad2","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21356","last_updated":"2025-07-15T09:23:42Z","snapshot_observed_at":"2026-08-16T11:46:59.313125Z","submitted_at":"2025-04-30T06:30:48Z","title":"Nexus-Gen: Unified Image Understanding, Generation, and Editing via Prefilled Autoregression in Shared Embedding Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21356","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Nexus-gen: Unified image understanding, generation, and editing via prefilled autoregression in shared embedding space.arXiv preprint arXiv:2504.21356, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2504.21356","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:db323fbd1de685ac4c6bad8202630569acac27c3701e1a6b51b326bbfc38e9b1","observation_id":"937d8872-13d5-494c-b4d3-060343842ae0","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05176","last_updated":"2025-06-11T02:54:49Z","snapshot_observed_at":"2026-08-20T02:29:37.867282Z","submitted_at":"2025-06-05T15:49:48Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05176","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Qwen3 embedding: Advancing text embedding and reranking through foundation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2506.05176","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:c8797ebcf720900d94a65d2d0319ba19a5b933bef5a6cbc9defaa6a074600be4","observation_id":"02ec4337-884a-41a9-a60d-fba9b641e025","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Recognize anything: A strong image tagging model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:e4a6239e160931a35278d9be3f9fac4c8d11ed1818980219a531fe70ce1f4f15","observation_id":"69aa318b-a947-4cbe-a5c6-4cea9f9c0510","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-08-16T15:00:37.541236Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning.arXiv preprint arXiv:2309.07915, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:8e32af799e5a21a73aa2531ac5e1e94a594fcb3a2250a6d8971a7590643de34f","observation_id":"cc5a4c69-2201-4625-91c6-b326f0c9c601","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.NeurIPS, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:4cc530b65a7a4c30874bf86f003c93799debc5937ea16e3b1a6ea18bf74a4cba","observation_id":"04efb5d9-1e1d-49c3-ad90-63191f9bfbb5","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13164","last_updated":"2025-03-31T20:03:34Z","snapshot_observed_at":"2026-08-20T13:36:14.494449Z","submitted_at":"2024-03-19T21:31:56Z","title":"VL-ICL Bench: The Devil in the Details of Multimodal In-Context Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13164","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Vl-icl bench: The devil in the details of multimodal in-context learning.arXiv preprint arXiv:2403.13164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2403.13164","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:c572cbfeaa80b404eb6ea1deef315b66e2d90d397ab5d1e2602dacb622459d0a","observation_id":"ced217b6-825d-472f-9eb2-4d0ad76de108","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2603.24690."}