{"as_of":"2026-08-08T10:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d2c73827a0ecf45d1eac2bdfad7d158abf4b7349fa00554d3888df8d0f32af62","coverage":[{"denominator":141,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:32:13.382009Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.02308/citation-record","integrity":"/paper/2506.02308/integrity","json":"/paper/2506.02308/citation-record.json","paper":"/paper/2506.02308"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:04.527558Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:04.527558Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:693c068172ab7fd8e5c8b3846e37fa8e8d7f789c0a168b10184cff389ab3a8b4","observation_id":"4e72a6ff-7a11-48b4-ae88-cd378c6cc080","resolution":{"observed_at":"2026-08-07T11:32:04.527558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:04.562670Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:04.562670Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:903b159abca7452c86a46f44b5b124f929191aa3540c40e61e48d91ecf797935","observation_id":"5d9e4a59-fcbb-4154-a3dc-00777f240c32","resolution":{"observed_at":"2026-08-07T11:32:04.562670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:04.700976Z","title":"Gated multimodal units for information fusion","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:04.700976Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:c18ba0598e64f99d56c216309129be030f14cb916f87bd6d4222e107b505cace","observation_id":"9c4ecb82-6154-4acc-a4fb-6b44987a6151","resolution":{"observed_at":"2026-08-07T11:32:04.700976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T11:32:04.747469Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models.arXiv preprint arXiv:2308.01390, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:04.747469Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:e8e6dca43d2d30ac6d10a9e0fa954b27af9758a687e0aa722d1bb999b041e16a","observation_id":"6ae9519e-fc8d-4d7e-8576-94f679fb99ae","resolution":{"observed_at":"2026-08-07T11:32:04.747469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16890","last_updated":"2023-09-04T15:06:15Z","snapshot_observed_at":"2026-07-06T16:12:55.132006Z","submitted_at":"2023-08-31T17:52:04Z","title":"TouchStone: Evaluating Vision-Language Models by Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16890","snapshot_observed_at":"2026-08-07T11:32:04.798457Z","title":"Touchstone: Evaluating vision-language models by language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:04.798457Z"},"links":{"cited_paper":"/paper/2308.16890","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:afe11cf2b5fef08a97b72ee61d7464809c9dc224a176215be8c24dc3366eae4b","observation_id":"cc05ce37-688a-45b6-a477-0b980139db4f","resolution":{"observed_at":"2026-08-07T11:32:04.798457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:04.843432Z","title":"Multimodal machine learning: A survey and taxonomy.IEEE transactions on pattern analysis and machine intelligence, 41(2):423–443, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:04.843432Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:557b53efd0693f365b1c432c5b2d30765f79fa07ef27095b558fe0e97a83514a","observation_id":"5e354e26-95aa-4a78-a683-4a3af107b05d","resolution":{"observed_at":"2026-08-07T11:32:04.843432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:04.906604Z","title":"Routledge, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:04.906604Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:389e0177f6d3accbb731b69535d4bb9795e1cf8c2b07790d44791fe50a6758aa","observation_id":"6f29f9f5-bce4-4f82-b8e0-885e41700c97","resolution":{"observed_at":"2026-08-07T11:32:04.906604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:04.936237Z","title":"Introducing our multimodal models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:04.936237Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:20e778827f0a77b6206cea3d8d673d9ac271b7180ed0980bc4d539916066fb2c","observation_id":"e89c36fe-d388-433f-bed6-d92df087b41a","resolution":{"observed_at":"2026-08-07T11:32:04.936237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.08303","last_updated":"2017-02-27T14:37:21Z","snapshot_observed_at":"2026-07-06T05:31:32.333303Z","submitted_at":"2017-02-27T14:37:21Z","title":"Identifying beneficial task relations for multi-task learning in deep neural networks","version":1},"cited_work":{"arxiv_id":"1702.08303","doi":null,"metadata_source":"pith","pith_arxiv_id":"1702.08303","snapshot_observed_at":"2026-08-07T11:32:18.369166Z","title":"Identifying beneficial task relations for multi-task learning in deep neural networks","venue":"cs.CL","work_id":"7e8a0902-5bf9-4fd3-ac7c-89e9da6f913f","year":2017},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:05.006588Z"},"links":{"cited_paper":"/paper/1702.08303","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:2a1eab68b8733dfd276cfa7a32852cf0ad67ec8e3e9a44b3fa3467dfd4732b6e","observation_id":"6433d950-8cef-4b59-9237-4728e1b49ee0","resolution":{"observed_at":"2026-08-07T11:32:18.420739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06595","last_updated":"2023-12-26T15:57:47Z","snapshot_observed_at":"2026-07-06T16:05:35.645037Z","submitted_at":"2023-08-12T15:27:51Z","title":"VisIT-Bench: A Benchmark for Vision-Language Instruction Following Inspired by Real-World Use","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06595","snapshot_observed_at":"2026-08-07T11:32:05.026455Z","title":"Visit-bench: A benchmark for vision-language instruction following inspired by real-world use.arXiv preprint arXiv:2308.06595, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:05.026455Z"},"links":{"cited_paper":"/paper/2308.06595","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:592c3a5a5173baed9869206a442f864af700d0f403fda055bde32b83e900a515","observation_id":"cd280595-afce-46ff-96b7-565d47a44a47","resolution":{"observed_at":"2026-08-07T11:32:05.026455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.029575Z","title":"Decimer—hand- drawn molecule images dataset.Journal of Cheminformatics, 14(1):1–4, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:05.029575Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:a797b55d64a1054b58f97cb35e529c63f229800014ecaa6e0e343e0425f9a81b","observation_id":"dcab9994-dcdf-4bb0-b60a-f1da440d338d","resolution":{"observed_at":"2026-08-07T11:32:05.029575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.037177Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:05.037177Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:0af67cdc53cde04be9a27942feb0ca0dd698ac6eaea50c82e46223da00b31546","observation_id":"21781edd-69dc-4733-95b0-e8b71e70acc6","resolution":{"observed_at":"2026-08-07T11:32:05.037177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.151820Z","title":"Multi-modal sarcasm detection in Twitter with hierarchical fusion model","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:05.151820Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:cd1d8be82cb930b4f5d5d93d39dfc9b5ad27219fbbab819b85ffc09c545fb46b","observation_id":"ad46f82c-7692-4788-ad1a-1e9f16dd11ad","resolution":{"observed_at":"2026-08-07T11:32:05.151820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.213593Z","title":"Multitask learning.Machine learning, 28:41–75, 1997","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:05.213593Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:45f35566aca56291cc9daa8df1abe99243a5e18da34a86daf4db9280c2da69e5","observation_id":"d774d44a-756b-4322-ae24-040c575f5fd8","resolution":{"observed_at":"2026-08-07T11:32:05.213593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.268085Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:05.268085Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:724a0432e58529ca5b9a0a655dae877a7e1668feba88cc55c97dad0d1ad08de6","observation_id":"76fe4df9-9b3b-4f6e-907d-f5b74a3c32d4","resolution":{"observed_at":"2026-08-07T11:32:05.268085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.304510Z","title":"Remote sensing image scene classification: Benchmark and state of the art.Proceedings of the IEEE, 105(10):1865–1883, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:05.304510Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:50eb8e7abbc4a9df2b281bcd668df3040fc7a0fc639687b203c6a2a7bcf1ad03","observation_id":"0f224f8d-8a5b-49b5-afee-cc1d273be619","resolution":{"observed_at":"2026-08-07T11:32:05.304510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.334394Z","title":"Scaling instruction-finetuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:05.334394Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:75bb3dc1ea105d6493c2c521327be9dac9c33e5e99c56dcfe6a31395ee227d94","observation_id":"32516e51-e7bb-4f50-b8e0-fb3821c725fa","resolution":{"observed_at":"2026-08-07T11:32:05.334394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03287","last_updated":"2023-11-07T02:18:48Z","snapshot_observed_at":"2026-08-08T00:04:37.857776Z","submitted_at":"2023-11-06T17:26:59Z","title":"Holistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03287","snapshot_observed_at":"2026-08-07T11:32:05.365315Z","title":"Holistic analysis of hallucination in gpt-4v (ision): Bias and interference challenges.arXiv preprint arXiv:2311.03287, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:05.365315Z"},"links":{"cited_paper":"/paper/2311.03287","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:767a54be61ecb3f04654aac71db7fb7ffc28022d553a4a308bf23f39608d500a","observation_id":"a342a713-9f91-4ec9-8763-5e592fbf8f3b","resolution":{"observed_at":"2026-08-07T11:32:05.365315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07667","last_updated":"2025-03-20T05:05:56Z","snapshot_observed_at":"2026-08-07T17:19:38.222448Z","submitted_at":"2025-03-09T01:45:05Z","title":"CLIMB: Data Foundations for Large Scale Multimodal Clinical Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07667","snapshot_observed_at":"2026-08-07T11:32:05.400551Z","title":"Climb: Data foundations for large scale multimodal clinical foundation models.arXiv preprint arXiv:2503.07667, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:05.400551Z"},"links":{"cited_paper":"/paper/2503.07667","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:65db2f4385614643738eb051fe62b17b0b0feab048a57581ebe0840ed0338891","observation_id":"173bcff0-9f5c-4431-bf94-66f0292c5824","resolution":{"observed_at":"2026-08-07T11:32:05.400551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.480514Z","title":"Rico: A mobile app dataset for building data-driven design applications","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:05.480514Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:8de4f65386950a0c530b92592eb345dbdd0fc8b6d1a6780e16990b7691cb27cd","observation_id":"9902121c-7620-4247-a60c-fac86ab9ee71","resolution":{"observed_at":"2026-08-07T11:32:05.480514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.627088Z","title":"Multi-task learning for contextual bandits","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:05.627088Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:2bafaace91d25c097e6d5a062159a07219319fc2d164eea3435a0bb4bad034c1","observation_id":"1fa4f4d7-5be0-4a03-9d1c-55e166867a6e","resolution":{"observed_at":"2026-08-07T11:32:05.627088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.719625Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:05.719625Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:bc580334825302d5eece2edef993dc152bb7d9a51c9412d83fdd588f6fa6e70e","observation_id":"e9e143eb-ebcd-49c2-99d8-933fd35ba783","resolution":{"observed_at":"2026-08-07T11:32:05.719625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:05.877074Z","title":"Regularized multi–task learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:05.877074Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:e9d6a359478c0804cb90e0295d2d2a0ded7da1083d6dd92247ab2bee44688e31","observation_id":"a7a989c2-da13-49c6-a0bb-e1c9fd05f7b3","resolution":{"observed_at":"2026-08-07T11:32:05.877074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d15-1021","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:16.797699Z","title":"A survey of current datasets for vision and language research","venue":null,"work_id":"46f3d73a-f1b0-44fc-9013-2c719c4319f1","year":2015},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:05.967677Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:9035fb72a401a5d265a01447d5a9f10d3273a091dbbf2c1b1d42172ee6b4a4d5","observation_id":"cc85cd95-1328-4e69-a9d1-3e194e70c192","resolution":{"observed_at":"2026-08-07T11:32:16.878332Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:06.122368Z","title":"Efficiently identifying task groupings for multi-task learning.Advances in Neural Information Processing Systems, 34:27503–27516, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:06.122368Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:ce7a0dbfc7c52ade509cfcc778df7cdf879b00ef222fb7c3f5634af4edf11de8","observation_id":"768b9948-d9bd-4d19-8276-08797925237a","resolution":{"observed_at":"2026-08-07T11:32:06.122368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T11:32:06.278770Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:06.278770Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:2c999f1597ea4812eb4fd367d1ea7775f9989e0de0d73532901105adaa02311f","observation_id":"ddc20d4c-2299-45cf-ae63-000c5ded65ad","resolution":{"observed_at":"2026-08-07T11:32:06.278770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:06.390507Z","title":"Enhancing knowledge transfer for task incremental learning with data-free subnetwork.Advances in Neural Information Processing Systems, 36: 68471–68484, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:06.390507Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:6975c8bfc8443cdbd0ad69b6ba20aad33fb775a99386af27427e1292f1edb457","observation_id":"290ba769-b032-4440-9962-5770afc355c6","resolution":{"observed_at":"2026-08-07T11:32:06.390507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:06.461953Z","title":"What makes the difference? an empirical comparison of fusion strategies for multimodal language analysis.Information Fusion, 66: 184–197, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:06.461953Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:7ee2bc611b394550fa321af39043556d8f48e09db59650688908ddaff7d0434a","observation_id":"0af10fe6-21dd-41c2-9bbd-98163be95788","resolution":{"observed_at":"2026-08-07T11:32:06.461953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:06.595058Z","title":"Challenges in representation learning: A report on three machine learning contests","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:06.595058Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:1a96175198f695591e6859deb4b9fc597b7a4d029e6610b65ed2d26c74484f30","observation_id":"1fdc778f-7ce6-47a4-a7ae-e42df988440c","resolution":{"observed_at":"2026-08-07T11:32:06.595058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12379","last_updated":"2024-07-04T02:55:57Z","snapshot_observed_at":"2026-07-06T17:05:27.005904Z","submitted_at":"2023-12-19T18:11:19Z","title":"Mixture of Cluster-conditional LoRA Experts for Vision-language Instruction Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12379","snapshot_observed_at":"2026-08-07T11:32:06.772655Z","title":"Mixture of cluster-conditional lora experts for vision-language instruction tuning.arXiv preprint arXiv:2312.12379, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:06.772655Z"},"links":{"cited_paper":"/paper/2312.12379","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:cc6add556f76ca653895c37f37c0c471555d8f258f919516ba438a31f4f0d375","observation_id":"d046d532-f878-482a-ba56-fd7bf699edb0","resolution":{"observed_at":"2026-08-07T11:32:06.772655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:32:06.924038Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:06.924038Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:4a88617c69b9bd8ff3fa7db2d1e2321116e64194e25105884d2dc638a3e1b170","observation_id":"a3f12151-0bfb-48b8-9b09-a99a9d9051e3","resolution":{"observed_at":"2026-08-07T11:32:06.924038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03226","last_updated":"2025-04-09T15:12:58Z","snapshot_observed_at":"2026-08-04T19:44:45.066573Z","submitted_at":"2024-02-05T17:37:46Z","title":"FuseMoE: Mixture-of-Experts Transformers for Fleximodal Fusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03226","snapshot_observed_at":"2026-08-07T11:32:07.087252Z","title":"Fusemoe: Mixture-of-experts transformers for fleximodal fusion.arXiv preprint arXiv:2402.03226, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:07.087252Z"},"links":{"cited_paper":"/paper/2402.03226","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:a50ebb6cbd9aeb1ebd350d713c3bdcb5956707f075e57c1951fd3e44965687d5","observation_id":"bbf73a16-98ee-4cde-b53b-9078408175a8","resolution":{"observed_at":"2026-08-07T11:32:07.087252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:07.200221Z","title":"The movielens datasets: History and context.Acm transactions on interactive intelligent systems (tiis), 5(4):1–19, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:07.200221Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:8d6748fc216df3796b7fa20ad087ff29a522443dc84fa3a361ae3d1125bec116","observation_id":"02835773-a720-4aa7-aa41-6c85c98c5c77","resolution":{"observed_at":"2026-08-07T11:32:07.200221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.10286","last_updated":"2020-03-07T17:55:41Z","snapshot_observed_at":"2026-07-06T09:06:42.071993Z","submitted_at":"2020-03-07T17:55:41Z","title":"PathVQA: 30000+ Questions for Medical Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.10286","snapshot_observed_at":"2026-08-07T11:32:07.313230Z","title":"Pathvqa: 30000+ questions for medical visual question answering.arXiv preprint arXiv:2003.10286, 2020","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:07.313230Z"},"links":{"cited_paper":"/paper/2003.10286","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:a1267bef4a03bc3e5673aee64ba4ef850c3b55270111febced6f79c1998145f5","observation_id":"fe890e94-9343-4d1e-a87d-64e1f16ff1e2","resolution":{"observed_at":"2026-08-07T11:32:07.313230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06293","last_updated":"2023-07-06T06:20:00Z","snapshot_observed_at":"2026-07-31T17:47:59.345850Z","submitted_at":"2022-09-13T20:54:00Z","title":"Do Androids Laugh at Electric Sheep? Humor \"Understanding\" Benchmarks from The New Yorker Caption Contest","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06293","snapshot_observed_at":"2026-08-07T11:32:07.406001Z","title":"understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:07.406001Z"},"links":{"cited_paper":"/paper/2209.06293","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:892d75b27068f349bb73fd7fecb55be7ca61258e0e78ddf5c9935419e313d23c","observation_id":"5d8ce1ed-9b3e-4a1a-b565-7b8c9039a1ce","resolution":{"observed_at":"2026-08-07T11:32:07.406001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:07.530750Z","title":"Framing image description as a ranking task: Data, models and evaluation metrics.Journal of Artificial Intelligence Research, 47:853–899, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:07.530750Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:2e0fb26af52c243b8a9de77a02865d6d59f187c17abd37a8364795f11f75fb31","observation_id":"f73ceaf9-c10b-4494-a4e0-5da38ec49ce0","resolution":{"observed_at":"2026-08-07T11:32:07.530750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:07.603688Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:07.603688Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:65aa15b9e7498d7103490ffbe7bc1bf0ab3d78b51e45775026bd6eab61f980d9","observation_id":"9107c440-7526-485b-83cf-399bf2592576","resolution":{"observed_at":"2026-08-07T11:32:07.603688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:07.706753Z","title":"Language is not all you need: Aligning perception with language models.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:07.706753Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:7f8e08f6698e4b3525a96a013b39ee6b101582690f0f4feb5ecf05c78f702a45","observation_id":"79624a44-ee99-45fe-8a2f-a6ccd07ffcd1","resolution":{"observed_at":"2026-08-07T11:32:07.706753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:07.801704Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:07.801704Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:1e2487235351d11bac00c07692058a9989ee57a67598160cd76be1c8350f0a6a","observation_id":"e07bd960-e60c-4927-b867-ed39c1f51aca","resolution":{"observed_at":"2026-08-07T11:32:07.801704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13703","last_updated":"2023-05-23T05:41:18Z","snapshot_observed_at":"2026-08-08T02:50:11.613862Z","submitted_at":"2023-05-23T05:41:18Z","title":"MemeCap: A Dataset for Captioning and Interpreting Memes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13703","snapshot_observed_at":"2026-08-07T11:32:07.886072Z","title":"Memecap: A dataset for captioning and interpreting memes.arXiv preprint arXiv:2305.13703, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:07.886072Z"},"links":{"cited_paper":"/paper/2305.13703","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:47ca3c3b380f4ac8657c7a508f665556ac0c3acda657bd46cd0d8f8f1d1813c7","observation_id":"9d117f85-ae8e-4a0e-ba64-07e09f48724c","resolution":{"observed_at":"2026-08-07T11:32:07.886072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:07.962103Z","title":"Grounding, meaning and foundation models: Adventures in multimodal machine learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:07.962103Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:1008db780caee5e75657817fd0b4070771c07b4813643e1eae8fef736ba31e07","observation_id":"3e07980a-456e-42a0-9235-cebecffaea29","resolution":{"observed_at":"2026-08-07T11:32:07.962103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:08.057119Z","title":"The hateful memes challenge: Detecting hate speech in multimodal memes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:08.057119Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:92b1451e60249af172ed5a783f056fbf9ff50e36b8da5a3fd3c04deb05f5c7fc","observation_id":"5b6b26b7-74c5-4438-b0ad-ca60c5e80416","resolution":{"observed_at":"2026-08-07T11:32:08.057119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:08.134800Z","title":"Grounding language models to images for multimodal inputs and outputs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:08.134800Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:ba734e183f18bdbb039f47b94dc56db56194da4915227f44e590729e99d81edb","observation_id":"6ba146e0-c0e7-482f-9c0d-e1241aa6cfcc","resolution":{"observed_at":"2026-08-07T11:32:08.134800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:08.213341Z","title":"Integrating text and image: Determining multimodal document intent in instagram posts","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:08.213341Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:dc35160246b0017a3175fd9f5602c9f864fce4576d10fec4dbe4c981f1aefd7a","observation_id":"ebbdc4c9-9f27-46cd-8635-f465165eca7f","resolution":{"observed_at":"2026-08-07T11:32:08.213341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:08.289284Z","title":"A dataset of clinically generated visual questions and answers about radiology images.Scientific data, 5(1):1–10, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:08.289284Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:9220b31c58c0e1da4c278648b31cbc8d2152594fd5a1bb3870a3425d8caeb907","observation_id":"81367ec7-4bf7-4d58-8c13-4d395ffa3b38","resolution":{"observed_at":"2026-08-07T11:32:08.289284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:08.393758Z","title":"Visual question answering in radiology (vqa-rad), Feb 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:08.393758Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:2264759a1dec8d34034d7d8eb3bd63154fe516292c88715e3ee7dd353e1d9957","observation_id":"7bf7604b-2f7c-40fc-a505-bc6a1c7de0f0","resolution":{"observed_at":"2026-08-07T11:32:08.393758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:08.494742Z","title":"Instruction matters: A simple yet effective task selection for optimized instruction tuning of specific tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:08.494742Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:c079c867efd21dcee9bee2327d62b829e52e9e45098055c1e80ef1d2ac2329e1","observation_id":"0e1cea30-994e-4a38-829b-4aa36efec105","resolution":{"observed_at":"2026-08-07T11:32:08.494742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16418","last_updated":"2024-10-17T01:57:27Z","snapshot_observed_at":"2026-07-06T18:05:25.418545Z","submitted_at":"2024-04-25T08:49:47Z","title":"Instruction Matters: A Simple yet Effective Task Selection for Optimized Instruction Tuning of Specific Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16418","snapshot_observed_at":"2026-08-07T11:32:08.590738Z","title":"INSTA: Instruction-based task selection for optimized instruction tuning.arXiv preprint arXiv:2404.16418, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:08.590738Z"},"links":{"cited_paper":"/paper/2404.16418","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:2fbd9156fd02bc86f3659a57f150667c23d56925dd29632e11334a004d32802a","observation_id":"12000cb8-bd3f-4ebb-bdd0-71b7a6c84ed9","resolution":{"observed_at":"2026-08-07T11:32:08.590738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04287","last_updated":"2023-11-07T19:00:56Z","snapshot_observed_at":"2026-07-06T16:44:27.404644Z","submitted_at":"2023-11-07T19:00:56Z","title":"Holistic Evaluation of Text-To-Image Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04287","snapshot_observed_at":"2026-08-07T11:32:08.663980Z","title":"Holistic evaluation of text-to-image models.arXiv preprint arXiv:2311.04287, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:08.663980Z"},"links":{"cited_paper":"/paper/2311.04287","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:150e614cef11364b69b03abda3a553132da5dc91455b9054085d6087a235ca80","observation_id":"3339b701-7b54-4569-b8b0-1a67bf608d74","resolution":{"observed_at":"2026-08-07T11:32:08.663980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:08.716998Z","title":"Enrico: A dataset for topic modeling of mobile ui designs","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:08.716998Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:d508e9d5b0db7f567958f5c0da3023f0fd38dd510e8525cfb70905a40220ca23","observation_id":"c37fffa3-e70f-4ba6-97e2-2061b0cf5c92","resolution":{"observed_at":"2026-08-07T11:32:08.716998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T11:32:08.822173Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension.arXiv preprint arXiv:2307.16125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:08.822173Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:227fddfabbd07db08681ae24ab6154105b8495a6506b942a5db94ff1ff9b60b7","observation_id":"90f00e84-b636-4dd1-947c-a54aa87792ed","resolution":{"observed_at":"2026-08-07T11:32:08.822173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:08.910355Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:08.910355Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:9f782d7c312df44f2791f17d173901ae895d69c79278254690d06d0b0f99634b","observation_id":"8a5b6c77-ff9a-45c1-a1cf-45f3239321ec","resolution":{"observed_at":"2026-08-07T11:32:08.910355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-07T11:32:09.002796Z","title":"Blip-2: Bootstrapping language-image pre- training with frozen image encoders and large language models.arXiv preprint arXiv:2301.12597, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:09.002796Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:23db1201c8624cc13d31e9c8a4e76780fa6cea90ea27b7f7de372969afc693c0","observation_id":"e19ecf89-d1a1-4719-b260-ce494f80e05b","resolution":{"observed_at":"2026-08-07T11:32:09.002796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-07T11:32:09.111934Z","title":"Visualbert: A simple and performant baseline for vision and language.arXiv preprint arXiv:1908.03557, 2019","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:09.111934Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:96127e07bfe78a9162c0eeb12619750594eb2becbb20bb81bdcc128791fc15d5","observation_id":"8675a51e-c40c-4633-b0ee-8bd0ec2ec42a","resolution":{"observed_at":"2026-08-07T11:32:09.111934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12774","last_updated":"2025-07-17T17:27:11Z","snapshot_observed_at":"2026-08-05T23:02:26.278603Z","submitted_at":"2024-10-16T17:49:45Z","title":"Identifying Task Groupings for Multi-Task Learning Using Pointwise V-Usable Information","version":2},"cited_work":{"arxiv_id":"2410.12774","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12774","snapshot_observed_at":"2026-08-07T11:32:18.044616Z","title":"Identifying Task Groupings for Multi-Task Learning Using Pointwise V-Usable Information","venue":"cs.CL","work_id":"a5a22c09-cfc0-4ac9-990f-6493ae9f8dcc","year":2024},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:09.209151Z"},"links":{"cited_paper":"/paper/2410.12774","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:496693a6b8d704168065cd21e2daa45c0e4fe46ffce6627ae85306e65f6987ce","observation_id":"a2fa1d85-5890-4ecd-9287-59c6b632f8ef","resolution":{"observed_at":"2026-08-07T11:32:18.162639Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02569","last_updated":"2023-10-17T08:11:15Z","snapshot_observed_at":"2026-08-07T09:02:15.560483Z","submitted_at":"2023-10-04T04:07:37Z","title":"ReForm-Eval: Evaluating Large Vision Language Models via Unified Re-Formulation of Task-Oriented Benchmarks","version":2},"cited_work":{"arxiv_id":"2310.02569","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.02569","snapshot_observed_at":"2026-08-07T11:32:17.863087Z","title":"ReForm-Eval: Evaluating Large Vision Language Models via Unified Re-Formulation of Task-Oriented Benchmarks","venue":"cs.CV","work_id":"dcbcace0-b220-4a31-ab17-61d7d9e47272","year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:09.315467Z"},"links":{"cited_paper":"/paper/2310.02569","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:70cb18f4b6160ee9c34fa352f21eab8f02b1938208496c7b4e0d9c58782170cc","observation_id":"7251f186-dc2b-4614-a44f-c7f06692135f","resolution":{"observed_at":"2026-08-07T11:32:17.935739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16843","last_updated":"2025-03-21T04:31:09Z","snapshot_observed_at":"2026-08-07T16:47:32.624998Z","submitted_at":"2025-03-21T04:31:09Z","title":"LoRASculpt: Sculpting LoRA for Harmonizing General and Specialized Knowledge in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2503.16843","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.16843","snapshot_observed_at":"2026-08-07T11:32:17.652014Z","title":"LoRASculpt: Sculpting LoRA for Harmonizing General and Specialized Knowledge in Multimodal Large Language Models","venue":"cs.CV","work_id":"b54b624d-b7d4-4d5b-83bf-f230ac8a6ca5","year":2025},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:09.418694Z"},"links":{"cited_paper":"/paper/2503.16843","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:3d04b35c72bbe685d09710c8839a3a9711578a47625031b231cfd05cc12ecf2d","observation_id":"a3406c66-9c72-4b2f-8325-7026a08654c5","resolution":{"observed_at":"2026-08-07T11:32:17.755225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:09.534609Z","title":"Multibench: Multiscale benchmarks for multimodal representation learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:09.534609Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:85f072a2ca5eb1a4b98ca860cf1ca1792efa90f407be297d7cfd3426636264a6","observation_id":"72297dd7-f86d-46e7-bd84-320cc9fdadf0","resolution":{"observed_at":"2026-08-07T11:32:09.534609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01311","last_updated":"2023-06-28T17:58:11Z","snapshot_observed_at":"2026-07-06T12:43:24.521815Z","submitted_at":"2022-03-02T18:56:20Z","title":"High-Modality Multimodal Transformer: Quantifying Modality & Interaction Heterogeneity for High-Modality Representation Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.01311","snapshot_observed_at":"2026-08-07T11:32:09.629828Z","title":"High-modality multimodal transformer: Quanti- fying modality & interaction heterogeneity for high-modality representation learning.arXiv preprint arXiv:2203.01311, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:09.629828Z"},"links":{"cited_paper":"/paper/2203.01311","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:3d2a00f6bebf1ab3bddd77f84345c44ff8c8bf67faf850031100a0f81bf8b0c0","observation_id":"70d246e9-cf60-4749-819d-90584ff1b2f8","resolution":{"observed_at":"2026-08-07T11:32:09.629828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:09.749214Z","title":"Quantifying & modeling multimodal interac- tions: An information decomposition framework","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:09.749214Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:74c3c19efa2748f65bbf7850c3039ae414cac849c7f61c6925f3a882c431b369","observation_id":"9f41e533-ab7a-411b-ab1c-e99c48761650","resolution":{"observed_at":"2026-08-07T11:32:09.749214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:09.887313Z","title":"Foundations & trends in multimodal machine learning: Principles, challenges, and open questions.ACM Computing Surveys, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:09.887313Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:b96b334942384c49db28615be5fe10e6adbddb596e13392b71542775f80c2339","observation_id":"6b22747e-c6cf-4576-8539-59fe22518dc3","resolution":{"observed_at":"2026-08-07T11:32:09.887313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:09.983756Z","title":"Hemm: Holistic evaluation of multimodal foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:09.983756Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:1397274f1d7b2c25a347891dc6dec8e4efa28f8b06cdcb0fdd5448514570f8e9","observation_id":"6b6ca40b-4c35-436d-9848-aaaf7681f027","resolution":{"observed_at":"2026-08-07T11:32:09.983756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:10.038516Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:10.038516Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:ecf4caa9d8c5b4b02d8cc4a82c53b8a6326ee560782c724d7efa877555b02e57","observation_id":"c7a293f6-c050-41ea-937e-61a38f8899be","resolution":{"observed_at":"2026-08-07T11:32:10.038516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:10.106641Z","title":"Slake: A semantically-labeled knowledge-enhanced dataset for medical visual question answering","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:10.106641Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:9c8631c670c3ee0d867038d09a171b42ed7cab90881874674e66274e51285977","observation_id":"c5a4df77-f579-494e-a5d5-dd4f17f3f023","resolution":{"observed_at":"2026-08-07T11:32:10.106641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T11:32:10.199856Z","title":"Visual instruction tuning.arXiv preprint arXiv:2304.08485, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:10.199856Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:6435e745b1a2caa0bf7c12063c36f057277fed926e80888ddfb683385283eeae","observation_id":"a369bfd1-54e3-47bf-b801-6809145c68af","resolution":{"observed_at":"2026-08-07T11:32:10.199856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15685","last_updated":"2024-04-16T02:46:58Z","snapshot_observed_at":"2026-07-06T17:07:52.197869Z","submitted_at":"2023-12-25T10:29:28Z","title":"What Makes Good Data for Alignment? A Comprehensive Study of Automatic Data Selection in Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15685","snapshot_observed_at":"2026-08-07T11:32:10.270829Z","title":"What makes good data for alignment? a comprehensive study of automatic data selection in instruction tuning.arXiv preprint arXiv:2312.15685, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:10.270829Z"},"links":{"cited_paper":"/paper/2312.15685","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:32ac566d8aea3a9839a5cb912b9f921ec4faf83cb784c0b7004718e906a77387","observation_id":"acb3b8f2-44d4-479b-81ce-0e829631ad69","resolution":{"observed_at":"2026-08-07T11:32:10.270829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T11:32:10.345380Z","title":"Mmbench: Is your multi-modal model an all-around player?arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:10.345380Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:b157dc26dc262353b0c6fbbc05c3a9703b6dc5a39e377da5c03844609b494837","observation_id":"24f00f28-3cf7-493e-b113-c6dd6326232f","resolution":{"observed_at":"2026-08-07T11:32:10.345380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T11:32:10.410916Z","title":"Nvila: Efficient frontier visual language models.arXiv preprint arXiv:2412.04468, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:10.410916Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:d8d0312740f97a82a5ab98da94f8b93bdc97435c06cb2ed5bbf9a0d2bb34634e","observation_id":"bc85cb85-975e-4319-8afc-377612f6b484","resolution":{"observed_at":"2026-08-07T11:32:10.410916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:10.465143Z","title":"The flan collection: Designing data and methods for effective instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:10.465143Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:922a65d7370e0bb03835fc12e278becba7a6ef668819d0e525d214681f8aa459","observation_id":"358804ef-e94f-4b19-b305-1c4f584a089b","resolution":{"observed_at":"2026-08-07T11:32:10.465143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:10.596512Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:10.596512Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:3f942d3fa0df0f52f0e5cc492962c24f0fb3e1cb486aba3cb43009f4f3ed142f","observation_id":"6138fea2-d956-455b-88ca-fe92967b3a2d","resolution":{"observed_at":"2026-08-07T11:32:10.596512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:10.690316Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:10.690316Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:816dacd802e05a040370bac129bb0e12e67a1140abefdae30e2880557ba21ac0","observation_id":"e22de362-4a5e-46c7-9914-ff50055fd6af","resolution":{"observed_at":"2026-08-07T11:32:10.690316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:10.751352Z","title":"Modeling task relationships in multi-task learning with multi-gate mixture-of-experts","venue":null,"work_id":null,"year":1930},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:10.751352Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:57ca08dafd128515a7e7cfd0ebf9cb87777e57ddd881d7b095bbc4fedc74f9e5","observation_id":"e82fa458-0e23-448a-9146-d01f3efe5fc3","resolution":{"observed_at":"2026-08-07T11:32:10.751352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:10.833909Z","title":"A taxonomy of relationships between images and text","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:10.833909Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:f35f5584e2097d35182d0ad2a3825f47f291885b753dfdb5da81becd664408cb","observation_id":"e4f8709e-9072-4134-ad22-b450a213f0ee","resolution":{"observed_at":"2026-08-07T11:32:10.833909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01017","last_updated":"2022-07-08T12:00:51Z","snapshot_observed_at":"2026-08-03T15:35:05.073940Z","submitted_at":"2022-02-02T13:21:53Z","title":"Multi-Task Learning as a Bargaining Game","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.01017","snapshot_observed_at":"2026-08-07T11:32:10.907531Z","title":"Multi-task learning as a bargaining game.arXiv preprint arXiv:2202.01017, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:10.907531Z"},"links":{"cited_paper":"/paper/2202.01017","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:d5277de9e9f422cb989311647d9d524bbad3591d4bb6e59097d7bf8fb6a037a5","observation_id":"3a885e73-e46e-44de-937d-a8f1211fb382","resolution":{"observed_at":"2026-08-07T11:32:10.907531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:11.004205Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:11.004205Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:f5e57ea5496f6a557bbe04ae7f59649f5718bd9d82c20fd4e85f2f35013ee42b","observation_id":"38a13155-3f7d-4e6a-9d2a-f4d4255497fd","resolution":{"observed_at":"2026-08-07T11:32:11.004205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-07T11:32:11.089611Z","title":"Kosmos- 2: Grounding multimodal large language models to the world.arXiv preprint arXiv:2306.14824, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:11.089611Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:65a3ba4ab1a273f293d60f94c7c85a4eebb28556a609fbba7c053f80a5da1e97","observation_id":"50ca30bf-cb60-4064-8692-675a772afe83","resolution":{"observed_at":"2026-08-07T11:32:11.089611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.05987","last_updated":"2019-06-11T13:13:46Z","snapshot_observed_at":"2026-08-06T12:40:13.289534Z","submitted_at":"2019-03-14T13:32:31Z","title":"To Tune or Not to Tune? Adapting Pretrained Representations to Diverse Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.05987","snapshot_observed_at":"2026-08-07T11:32:11.173110Z","title":"To tune or not to tune? adapting pretrained representations to diverse tasks.arXiv preprint arXiv:1903.05987, 2019","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:11.173110Z"},"links":{"cited_paper":"/paper/1903.05987","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:6690f86af6d32be3771481dcd1b21d94797e01dea9d60295a614ff01aa87f618","observation_id":"589ed68d-a688-407b-97c8-126f0f7d2be0","resolution":{"observed_at":"2026-08-07T11:32:11.173110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:11.335880Z","title":"Connecting vi- sion and language with localized narratives","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:11.335880Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:8ff0347a8b26d548446ceb14379aba5aa787d1f9178523bb9986cd84d6f41bc2","observation_id":"b16046a3-756e-449e-9dfc-c7732505f577","resolution":{"observed_at":"2026-08-07T11:32:11.335880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:11.434785Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:11.434785Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:ea21f6b31ee00c69265e37c7e3c6a8f6a7846f60781561c258f7e53286ebcdfa","observation_id":"fbd1ea9b-431c-42ee-8189-12cbe4615956","resolution":{"observed_at":"2026-08-07T11:32:11.434785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:11.524533Z","title":"Direct preference optimization: Your language model is secretly a reward model.Advances in Neural Information Processing Systems, 36:53728–53741, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:11.524533Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:824d12bce2a8d85644c40f395d1c664216ab1dc7a6c450a14c2f8e6b12c03df7","observation_id":"5d51db8a-ffcd-49a5-9f94-83ecae176c6c","resolution":{"observed_at":"2026-08-07T11:32:11.524533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:11.619517Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:11.619517Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:b050844a5e79df4e659718506a9f0972e875b7afde0832b1498bdef4d8ba4372","observation_id":"905d2572-20f2-4d9f-bc59-472f188a60e4","resolution":{"observed_at":"2026-08-07T11:32:11.619517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08207","last_updated":"2022-03-17T17:53:01Z","snapshot_observed_at":"2026-07-06T11:58:21.596920Z","submitted_at":"2021-10-15T17:08:57Z","title":"Multitask Prompted Training Enables Zero-Shot Task Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08207","snapshot_observed_at":"2026-08-07T11:32:11.690608Z","title":"Multitask prompted training enables zero-shot task generalization.arXiv preprint arXiv:2110.08207, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:11.690608Z"},"links":{"cited_paper":"/paper/2110.08207","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:8d07bd7ebc63e9a75b96f4b6962b8d6bd35e72571d3945716835d21556890090","observation_id":"7c8118fb-a7cd-4d4f-b76a-d8fedd103c6c","resolution":{"observed_at":"2026-08-07T11:32:11.690608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:11.777240Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:11.777240Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:54584863b870adab53cd35706acdce0774dd976696b1951d867523b2056cb658","observation_id":"472364db-c53c-4439-b64d-349bfecdc59d","resolution":{"observed_at":"2026-08-07T11:32:11.777240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12709","last_updated":"2024-07-17T16:31:38Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T16:31:38Z","title":"MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12709","snapshot_observed_at":"2026-08-07T11:32:11.897837Z","title":"Mome: Mixture of multimodal experts for generalist multimodal large language models.arXiv preprint arXiv:2407.12709, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:11.897837Z"},"links":{"cited_paper":"/paper/2407.12709","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:5431ce5abf85399ba5db5cb1183ffb53d8eb51c316b74a7ac434698cbc36e453","observation_id":"e61748c8-ef1e-46a9-b396-87264baf6307","resolution":{"observed_at":"2026-08-07T11:32:11.897837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15896","last_updated":"2024-12-06T00:41:15Z","snapshot_observed_at":"2026-07-06T17:34:57.509162Z","submitted_at":"2024-02-24T20:15:31Z","title":"Multimodal Instruction Tuning with Conditional Mixture of LoRA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15896","snapshot_observed_at":"2026-08-07T11:32:11.968805Z","title":"Multimodal instruction tuning with conditional mixture of lora.arXiv preprint arXiv:2402.15896, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:11.968805Z"},"links":{"cited_paper":"/paper/2402.15896","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:9d98fe60aef0954641a15c9114afb0dcce1ae5ede07f6e647d77aee9e802a58f","observation_id":"55dbad53-eca4-4db8-b5f5-5471953cdc26","resolution":{"observed_at":"2026-08-07T11:32:11.968805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.09109","last_updated":"2019-05-31T20:24:48Z","snapshot_observed_at":"2026-08-07T20:57:27.191184Z","submitted_at":"2019-03-21T16:59:53Z","title":"A Principled Approach for Learning Task Similarity in Multitask Learning","version":2},"cited_work":{"arxiv_id":"1903.09109","doi":null,"metadata_source":"pith","pith_arxiv_id":"1903.09109","snapshot_observed_at":"2026-08-07T11:32:17.360324Z","title":"A Principled Approach for Learning Task Similarity in Multitask Learning","venue":"cs.LG","work_id":"347d7e35-026d-4e27-9e7e-4eb96c40b406","year":2019},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:12.056052Z"},"links":{"cited_paper":"/paper/1903.09109","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:84376e7a77223e33a20809d58db66426bcc06a57f20f12983f4405ebfe93a275","observation_id":"474173e2-3c80-4f77-a82d-8fa0fbb37145","resolution":{"observed_at":"2026-08-07T11:32:17.428702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:12.174376Z","title":"Guibas, Jitendra Malik, and Silvio Savarese","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:12.174376Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:9c39c3135d0ce1d1580af36c45b620c87fffd93206dac7668ad1fd141d492b88","observation_id":"f507c611-7c9e-4302-aa20-d2f80dbf868e","resolution":{"observed_at":"2026-08-07T11:32:12.174376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08530","last_updated":"2020-02-18T02:59:17Z","snapshot_observed_at":"2026-08-08T09:19:20.381840Z","submitted_at":"2019-08-22T17:59:30Z","title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08530","snapshot_observed_at":"2026-08-07T11:32:12.247002Z","title":"Vl-bert: Pre-training of generic visual-linguistic representations.arXiv preprint arXiv:1908.08530, 2019","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:12.247002Z"},"links":{"cited_paper":"/paper/1908.08530","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:3fddb034fef18b8c38c9c30bc9db29d1886fffa4db39d0dcb9696b5d8c5adf7a","observation_id":"ddd338b8-b98e-4bee-9eb0-11616d61f666","resolution":{"observed_at":"2026-08-07T11:32:12.247002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:12.321003Z","title":"A corpus of natural language for visual reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:12.321003Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:c397b020e99273b54ba66b42a1cad97bb7403ec5ab154a53cca8ebfff97484c4","observation_id":"0db03e46-08c1-4b7f-af66-5fd88c72a835","resolution":{"observed_at":"2026-08-07T11:32:12.321003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:12.460206Z","title":"Multimodal transformer for unaligned multimodal language sequences","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:12.460206Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:a1ffb429ca792dc8d088827400f5d5f582d413977e814b70192c02827d8ebf54","observation_id":"f4b9e7d4-e50b-4cd9-bb20-3f36bc1f00dd","resolution":{"observed_at":"2026-08-07T11:32:12.460206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:12.554019Z","title":"Multimodal few-shot learning with frozen language models.Advances in Neural Information Processing Systems, 34: 200–212, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:12.554019Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:c536cecfa9fc14e95fdbd924b5d9250d448fcc0d041de06f80739a2a0b629565","observation_id":"50ce583a-c8f9-4df7-b10a-bb0b97aa119c","resolution":{"observed_at":"2026-08-07T11:32:12.554019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:12.652313Z","title":"The inaturalist species classification and detection dataset-supplementary material.Reptilia, 32(400):1–3, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:12.652313Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:04e06d06cd0182f4d670b29670e76d75ffd0b149362ff1edcb47fdbf1b2f12c3","observation_id":"c0fd2c97-e468-422d-b884-af96401a9895","resolution":{"observed_at":"2026-08-07T11:32:12.652313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-07T11:32:12.736468Z","title":"Git: A generative image-to-text transformer for vision and language.arXiv preprint arXiv:2205.14100, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:12.736468Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:6ba3272d77d01d6c371fb3b5af00337cc240564ac9a32cdb7fc1ce55e2388e4e","observation_id":"cc27e696-39cc-4348-8753-55e5d6d6395a","resolution":{"observed_at":"2026-08-07T11:32:12.736468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T11:32:12.860372Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:12.860372Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:b9ffbef9f7bac1539c5da9c9d5e1643ae90ce631ab393e26d2f232e555a9cbff","observation_id":"a06b68e7-3638-4111-af79-e9f040f8cfa8","resolution":{"observed_at":"2026-08-07T11:32:12.860372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.07705","last_updated":"2022-10-24T07:00:15Z","snapshot_observed_at":"2026-07-06T13:00:53.618234Z","submitted_at":"2022-04-16T03:12:30Z","title":"Super-NaturalInstructions: Generalization via Declarative Instructions on 1600+ NLP Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.07705","snapshot_observed_at":"2026-08-07T11:32:12.947608Z","title":"Super- naturalinstructions: Generalization via declarative instructions on 1600+ nlp tasks.arXiv preprint arXiv:2204.07705, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:12.947608Z"},"links":{"cited_paper":"/paper/2204.07705","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:98d9d665e6f415279bb8c5568df6fc9495d05ec0ee2b16adb077f2b26f6de62a","observation_id":"c74420d2-fe47-45a7-8127-cbf5d76b1431","resolution":{"observed_at":"2026-08-07T11:32:12.947608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-07T11:32:13.042859Z","title":"Finetuned language models are zero-shot learners.arXiv preprint arXiv:2109.01652, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:13.042859Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:11d412097bb7f11d7d630c5b899301b2015ee2126dfd738c58d842e887f20498","observation_id":"5b734aa5-7731-4c40-9e97-9d368c1ba4cd","resolution":{"observed_at":"2026-08-07T11:32:13.042859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:13.109666Z","title":"On the road with gpt-4v(ision): Early explorations of visual-language model on autonomous driving, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:13.109666Z"},"links":{"citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:fb337697e44471fd4ea7940dc297744e4b19d0ed62062df0dae213445375df2c","observation_id":"d905f998-4953-4734-96dc-1096ee352a4a","resolution":{"observed_at":"2026-08-07T11:32:13.109666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1004.2515","last_updated":"2010-04-14T22:12:52Z","snapshot_observed_at":"2026-08-03T20:33:54.082561Z","submitted_at":"2010-04-14T22:12:52Z","title":"Nonnegative Decomposition of Multivariate Information","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1004.2515","snapshot_observed_at":"2026-08-07T11:32:13.263231Z","title":"Nonnegative decomposition of multivariate information.arXiv preprint arXiv:1004.2515, 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:13.263231Z"},"links":{"cited_paper":"/paper/1004.2515","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:16a141177fb3da212f8a30e097ba413de9dac3f9acc982886ca2c300e64cb133","observation_id":"ea17165a-e1cd-4a8a-955a-ef3e918e3154","resolution":{"observed_at":"2026-08-07T11:32:13.263231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07545","last_updated":"2024-08-20T14:59:55Z","snapshot_observed_at":"2026-08-02T13:00:05.823222Z","submitted_at":"2023-08-15T03:22:40Z","title":"Vision-Language Dataset Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07545","snapshot_observed_at":"2026-08-07T11:32:13.340080Z","title":"Multimodal dataset distillation for image-text retrieval","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:13.340080Z"},"links":{"cited_paper":"/paper/2308.07545","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:9c697300b732b22f748410f437a5e7051f021f5632ec42e811f81a2dbcb0fd34","observation_id":"c984e5dc-6606-476f-be84-b2f351141a27","resolution":{"observed_at":"2026-08-07T11:32:13.340080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09265","last_updated":"2023-06-15T16:39:24Z","snapshot_observed_at":"2026-07-06T15:43:03.878575Z","submitted_at":"2023-06-15T16:39:24Z","title":"LVLM-eHub: A Comprehensive Evaluation Benchmark for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09265","snapshot_observed_at":"2026-08-07T11:32:13.382009Z","title":"Lvlm-ehub: A comprehensive evaluation benchmark for large vision-language models.arXiv preprint arXiv:2306.09265, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:13.382009Z"},"links":{"cited_paper":"/paper/2306.09265","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:9d511195d21145819eea5d8436b844ebc9911605ec6c23b42594fe802fafe9bf","observation_id":"3d9636fd-d20f-46ff-aef4-26bb12c40bef","resolution":{"observed_at":"2026-08-07T11:32:13.382009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":94,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":141},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 141 outbound references and 0 inbound Pith citation observations for arXiv:2506.02308."}