{"as_of":"2026-08-19T13:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d5fee88f801bca808051c5d607e11de867ff00ae32bc07723279659fe1ae6f80","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:21:31.276109Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.08840/citation-record","integrity":"/paper/2411.08840/integrity","json":"/paper/2411.08840/citation-record.json","paper":"/paper/2411.08840"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:21:31.872262Z","title":"More specifically, we dynamically match the optimal aspect ratio from a pre-defined set of aspect ratios","venue":null,"work_id":"5ba0bf20-b30b-4b77-912e-f315e2018b73","year":2021},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.276109Z"},"links":{"citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:c4540d673d3b5c2ef3ace941ea8adf1c53e6ba01d697846c4b110a21ab44abbf","observation_id":"e4a1a8b6-d1a1-42d3-8707-fc29bd1b28b7","resolution":{"observed_at":"2026-08-12T21:21:31.882011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06512","last_updated":"2024-04-09T17:59:32Z","snapshot_observed_at":"2026-08-18T00:33:47.386234Z","submitted_at":"2024-04-09T17:59:32Z","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06512","snapshot_observed_at":"2026-08-12T21:21:31.157370Z","title":"Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Bin Wang, Linke Ouyang, Songyang Zhang, Haodong Duan, Wenwei Zhang, Yining Li, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.157370Z"},"links":{"cited_paper":"/paper/2404.06512","citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:31b0f4cb0a748ea7325902f1691249867a97f59f32d178420b11bd777831b6d0","observation_id":"001472b2-f566-40b5-b1e3-d5030bd4ffe4","resolution":{"observed_at":"2026-08-12T21:21:31.157370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T21:21:31.164588Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.164588Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:292b458d13e635acfb74274c19ad946f00e3d8f76fbceaa073c8aa59f19ac627","observation_id":"142eba1e-b3b4-41f4-a772-c423b5157bee","resolution":{"observed_at":"2026-08-12T21:21:31.164588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-12T21:21:31.195621Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.195621Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:903c0ff12a0e07274ad92636a93270f88d4feccceabdf08d2400c54a03eaecc3","observation_id":"af7160a4-22f0-41d1-b35b-6272f9fff9e0","resolution":{"observed_at":"2026-08-12T21:21:31.195621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T21:21:31.201755Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.201755Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:f371a37250492856d465f8375b75bbaa00ff6c6ddafb0b6cd13d4bce5dece76a","observation_id":"f5578964-dc53-41e4-a039-6108e00a76bb","resolution":{"observed_at":"2026-08-12T21:21:31.201755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-12T21:21:31.208152Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.208152Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:00cae78f1ffb9fa56a45b391f1ada74506a7661dc252f4d82181c16ae272ab9f","observation_id":"ad92f513-c98b-40e1-af4f-49b289e651c4","resolution":{"observed_at":"2026-08-12T21:21:31.208152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-16T14:12:38.033838Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-12T21:21:31.214170Z","title":"A survivor in the era of large- scale pretraining: An empirical study of one-stage referring expression comprehension","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.214170Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:7c3cbfe098f977275909e07eb7014e14a12f205c6bca622d8fbb3be5089d33ce","observation_id":"2c88423f-f7fb-41a1-9612-d905940e17da","resolution":{"observed_at":"2026-08-12T21:21:31.214170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-08-16T18:14:04.403890Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-12T21:21:31.226420Z","title":"Anand Mishra, Shashank Shekhar, Ajeet Kumar Singh, and Anirban Chakraborty","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.226420Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:192211e05986bacf10b6e98a9dc6ad92660ac6b450a6f1e3ad0bb4a76e931981","observation_id":"d6716bf1-354e-4cdc-9498-48cb07466df0","resolution":{"observed_at":"2026-08-12T21:21:31.226420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-12T21:21:31.232816Z","title":"Gemini Team, Rohan Anil, Sebastian Borgeaud, Yonghui Wu, Jean-Baptiste Alayrac, Jiahui Yu, Radu Soricut, Johan Schalkwyk, Andrew M Dai, Anja Hauth, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.232816Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:ffc1563a1d9871f18227b9d172ceba5afef5440133549a5f617ce963fd803407","observation_id":"95542b91-fafe-459b-b498-accacdcdc2e2","resolution":{"observed_at":"2026-08-12T21:21:31.232816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T21:21:31.238700Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.238700Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:1abbab151240c5b90d6ee001b94e8c96ca5bdea6af532998db9c6e3ef81d5cc8","observation_id":"a2d23893-0e01-46ba-9887-341cb2ad38ee","resolution":{"observed_at":"2026-08-12T21:21:31.238700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:21:31.245629Z","title":"Jun Xu, Tao Mei, Ting Yao, and Yong Rui","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.245629Z"},"links":{"citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:eabfe31cd2aa9efb1bd12e983853aa32515a36163a4585c0a4cf86995065ca7c","observation_id":"d0d15deb-c9c8-4ac0-b63d-6ea572fc1d9e","resolution":{"observed_at":"2026-08-12T21:21:31.245629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-18T03:16:44.825874Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-12T21:21:31.260276Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities.arXiv preprint arXiv:2308.02490,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.260276Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:b01c73db6c269b2c11efd893b8cad4eea5311dea583afee6649aa5b6e6801f21","observation_id":"8b9b1e8e-77b6-4105-8b12-dbc809a0b116","resolution":{"observed_at":"2026-08-12T21:21:31.260276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:21:31.903858Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":"63219afb-582a-490c-aeba-bf252e5c59ca","year":2023},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.267556Z"},"links":{"citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:a907ce1437417153b416af43899cb46ccf706c9e5dfe44067a79b35a0d61f4f9","observation_id":"4989d8fa-ab77-4f91-9f8f-634b06f8d027","resolution":{"observed_at":"2026-08-12T21:21:31.910068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:21:31.925904Z","title":"Licheng Yu, Patrick Poirson, Shan Yang, Alexander C Berg, and Tamara L Berg","venue":null,"work_id":"7e1b5245-740d-44d1-a755-3c3de8323090","year":2016},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.252469Z"},"links":{"citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:953044a6fa3b4aad6b6556148e08ea7fc9f44fd361e208303cc709e19392a1c0","observation_id":"2b51e270-0819-4985-b7db-2b6c60a43f96","resolution":{"observed_at":"2026-08-12T21:21:31.933268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04219","last_updated":"2023-11-07T18:59:58Z","snapshot_observed_at":"2026-08-16T14:45:10.647424Z","submitted_at":"2023-11-07T18:59:58Z","title":"OtterHD: A High-Resolution Multi-modality Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04219","snapshot_observed_at":"2026-08-12T21:21:31.183098Z","title":"Otterhd: A high-resolution multi-modality model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.183098Z"},"links":{"cited_paper":"/paper/2311.04219","citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:cb4e62a4f3154a821bb528ccf0d2f549ecfdf3f1d0436bf6e24623af3f9ca413","observation_id":"fd98e160-5018-4e77-874c-99b88dc14132","resolution":{"observed_at":"2026-08-12T21:21:31.183098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:21:31.177235Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.177235Z"},"links":{"citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:24779498b4063be44215d0094344e33dbeba0dc0887ff90eafc7dc3fa01ad5b5","observation_id":"e5f66227-56ea-4375-98be-376e58cebb61","resolution":{"observed_at":"2026-08-12T21:21:31.177235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:21:31.946112Z","title":"Chartqa: A bench- mark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"e1541aee-35fe-4d96-b3ca-80cfb439b852","year":2022},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.220432Z"},"links":{"citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:45095203b91501ef1b6a06b89386d1f9b66086b0fd1f790e3285903e143b6464","observation_id":"1de71c57-d720-4808-a494-35eb29de45a8","resolution":{"observed_at":"2026-08-12T21:21:31.952091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-12T21:21:31.171280Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.171280Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:3d660a715ecfe65271769c28ba9f7c8b03ac2a0c4e7497f425f79b804b4ece5f","observation_id":"272e81ab-a02a-4c4b-a2c1-78a7eb4e10a4","resolution":{"observed_at":"2026-08-12T21:21:31.171280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05949","last_updated":"2024-05-09T17:37:20Z","snapshot_observed_at":"2026-08-16T13:53:57.713807Z","submitted_at":"2024-05-09T17:37:20Z","title":"CuMo: Scaling Multimodal LLM with Co-Upcycled Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05949","snapshot_observed_at":"2026-08-12T21:21:31.189198Z","title":"Cumo: Scaling multimodal llm with co-upcycled mixture-of-experts, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.189198Z"},"links":{"cited_paper":"/paper/2405.05949","citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:3d8ccf38a2cdd7981312fcb48434a0e7ca8135fe70aec1cb340fb889fd5a1804","observation_id":"7be1c1a8-d2c4-4693-b890-d6e2937923ed","resolution":{"observed_at":"2026-08-12T21:21:31.189198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T21:21:31.144628Z","title":"Guiming Hardy Chen, Shunian Chen, Ruifei Zhang, Junying Chen, Xiangbo Wu, Zhiyi Zhang, Zhi- hong Chen, Jianquan Li, Xiang Wan, and Benyou Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.144628Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:3539bc1e029795ff8e949389ea9ae1d81ce96e0daf92279a758c27eb9a583a22","observation_id":"006412cd-00d2-4ff4-8d96-09bfdd895ee3","resolution":{"observed_at":"2026-08-12T21:21:31.144628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-12T21:21:31.150782Z","title":"Wenliang Dai, Junnan Li, Dongxu Li, Anthony Tiong, Junqi Zhao, Weisheng Wang, Boyang Li, Pascale Fung, and Steven Hoi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T21:21:31.150782Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2411.08840"},"observation_digest":"sha256:ef668f09fd79403af75c5ac4d71060a2d57b8c8e2f00ff1410fa4789360aad43","observation_id":"9c228e30-e9ff-4550-b0a7-45cf1fc1c0d2","resolution":{"observed_at":"2026-08-12T21:21:31.150782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.08840","last_updated":"2024-11-13T18:19:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T22:42:40.359834Z","submitted_at":"2024-11-13T18:19:51Z","title":"Multimodal Instruction Tuning with Hybrid State Space Models"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2411.08840."}