{"as_of":"2026-08-06T02:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e63cdaccf6f88a8b9cc29e59e59372277d53eb12025715aa21f41ff8308e668b","coverage":[{"denominator":119,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T13:48:48.661566Z","state":"measured"},{"denominator":134,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":134,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":34,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:01:21.945592Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T16:29:56.656404Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T17:20:53.687692Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2307.06281"},"observation_digest":"sha256:5dbc9c30fdb6a0e74ed2cd3058fc1b7f2149f8c323558622280b55876f9213d0","observation_id":"b3fc066f-f3ac-4c3b-8ef4-362c3f307064","resolution":{"observed_at":"2026-05-17T13:48:49.136768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-13T17:08:12.727773Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2311.12793"},"observation_digest":"sha256:b6485eae0c4ffd2f649816c559a07e70da00f7583483ab379d3ada5505671587","observation_id":"41e794b6-71a1-4de2-9f4c-ac9a97b67f59","resolution":{"observed_at":"2026-05-17T13:48:49.136768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"reference_index":178,"source":"pdf_text","source_observed_at":"2026-05-13T22:46:09.693156Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2312.14238"},"observation_digest":"sha256:037a5ca35e3a2799ed4d32455bc3c16d972392327d101e7f5ce44c64a3492aec","observation_id":"d37652f5-1113-400d-b4ba-ee967f234b94","resolution":{"observed_at":"2026-05-17T13:48:49.136768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-17T10:09:46.447508Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2401.10935"},"observation_digest":"sha256:f8291c4919fccb91de2b9cc475633658a72cb70a1f6944afd5abfc0d3c5d185f","observation_id":"b2c9972c-ba2a-4b05-90d0-110dcecc03af","resolution":{"observed_at":"2026-05-17T13:48:49.136768Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T02:33:30.143907Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2401.15947"},"observation_digest":"sha256:aaa9d3025474a01ea8f540de18c9893dd8309cafd874f45f7e57839b8a5573ca","observation_id":"cc57617f-34ea-4e67-a99d-838e2a7e39d9","resolution":{"observed_at":"2026-05-17T13:48:49.136768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-17T05:30:27.667126Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2401.16420"},"observation_digest":"sha256:b44b989813c2651cb8060bf059b603d8f7be5623798e75ce272c71d1e609825d","observation_id":"d214b145-3aa1-4b97-a10c-813ef3ddd0ec","resolution":{"observed_at":"2026-05-17T13:48:49.136768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2403.13805","last_updated":"2026-05-15T05:14:37Z","snapshot_observed_at":"2026-07-06T17:47:51.284226Z","submitted_at":"2024-03-20T17:59:55Z","title":"RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-24T03:31:58.848180Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2403.13805"},"observation_digest":"sha256:38df0ebc8754d9c14c41717927967548db8dd984a5ad24415342713c5c0a3f6e","observation_id":"d39d6b85-5063-48f2-8329-4a77b1a1ffbf","resolution":{"observed_at":"2026-05-24T03:33:50.806971Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T07:44:47.355960Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2403.18814"},"observation_digest":"sha256:0bd7756d18699bf8a0bddb7cc88a9a2f081c0bbbeb6f23fe755b18996cabc44e","observation_id":"900ac875-69ac-4afa-b294-7c739943f0a8","resolution":{"observed_at":"2026-05-17T13:48:49.136768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-02T21:55:15.857183Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T19:41:44.263663Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2403.20330"},"observation_digest":"sha256:3e8a890d119c878051ad7de44ef93a60a18b4a637ec22c807ccd5dec3e0909ac","observation_id":"f77d35f8-7e2d-43b0-b412-be587fbc5f5b","resolution":{"observed_at":"2026-05-17T13:48:49.136768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:2649d34271a1194c0a91bf097442940f36cbadd0577b5166cf1ba90ce65d96b3","observation_id":"7d393e68-5f8b-46e1-81f5-3e0696907aba","resolution":{"observed_at":"2026-05-17T13:48:49.136768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2406.14194","last_updated":"2026-04-05T17:10:43Z","snapshot_observed_at":"2026-07-06T18:34:10.892335Z","submitted_at":"2024-06-20T10:56:59Z","title":"VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T23:37:12.985780Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2406.14194"},"observation_digest":"sha256:68b3e14b47c6ed5b663682d24db3ad3861658eec73b08cd2b5f73938c72dfa16","observation_id":"4f73a51a-041b-4ea7-ae15-e33f1910efce","resolution":{"observed_at":"2026-05-23T23:38:37.332882Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":174,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:2ec474e07b1f9a539f67e38916973982f8927c8e1e25d19ddcf0238b8a7f0282","observation_id":"1a9c0f0d-1350-4044-8548-136d7ea41349","resolution":{"observed_at":"2026-05-17T13:48:49.136768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"reference_index":266,"source":"arxiv_source","source_observed_at":"2026-05-20T06:20:36.235304Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2408.04840"},"observation_digest":"sha256:6e83e013de8a345f3e284f875fb9963ade93847eb65c2b64617b3bfdba5e34fd","observation_id":"2159a0b1-d809-435c-9f0e-4c1390f85385","resolution":{"observed_at":"2026-05-20T06:20:36.575164Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-16T07:59:32.638758Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2408.13257"},"observation_digest":"sha256:028c79ae11291c62c838c79fbb27c517b4490994e4523f177275bb878e1d06dc","observation_id":"3461b7a8-4d8d-42da-a4f2-936186663aaa","resolution":{"observed_at":"2026-05-17T13:48:49.136768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-17T21:08:19.570050Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2501.01957"},"observation_digest":"sha256:7600d200bb372fc120ff1122edcb010429f794fc0f9d542b912a90bcda54ff11","observation_id":"fa85359e-ae8e-4aa4-8938-f8392019cbaa","resolution":{"observed_at":"2026-05-17T21:08:19.721250Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-07-06T20:17:47.599899Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-05-16T11:39:22.340737Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2501.04001"},"observation_digest":"sha256:3f4f0ad2fb3560011f3dc6b77fada4b1eff13376b62c4a6ba59b035db454e5a2","observation_id":"1bbac56b-66a6-443a-b7eb-0057d7443e67","resolution":{"observed_at":"2026-05-17T13:48:49.136768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:b8eb0d364dd2f1decb41bf4584f35e0c65485abd264e225c0739c34c2ed96344","observation_id":"86149ad6-9a2a-4921-a378-1339e2d11331","resolution":{"observed_at":"2026-05-17T13:48:49.136768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-08-05T21:01:21.945592Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09584","last_updated":"2025-08-14T11:57:08Z","snapshot_observed_at":"2026-08-05T21:01:20.567980Z","submitted_at":"2025-08-13T07:58:01Z","title":"SHALE: A Scalable Benchmark for Fine-grained Hallucination Evaluation in LVLMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T21:01:21.945592Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2508.09584"},"observation_digest":"sha256:ae19be01f3b5d68423bb3402c1909561a392bbe66ea5b370a97c8f9ada2e6e1d","observation_id":"0c4b6d2b-307f-4182-91e6-6717ded38838","resolution":{"observed_at":"2026-08-05T21:01:21.945592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2508.10016","last_updated":"2026-05-22T12:46:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-06T16:17:29Z","title":"Training-Free Multimodal Large Language Model Orchestration","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T00:12:39.834892Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2508.10016"},"observation_digest":"sha256:7b93b7bc63c310a784d439c33a6b796d758048451e2bb74595cc3a38e968e942","observation_id":"b76dc277-2c99-4e8b-95b7-b1b7602bae7c","resolution":{"observed_at":"2026-05-19T00:12:54.088430Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2508.10016","last_updated":"2026-05-22T12:46:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-06T16:17:29Z","title":"Training-Free Multimodal Large Language Model Orchestration","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-25T08:02:15.950975Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2508.10016"},"observation_digest":"sha256:bf2c2d100236320c8d02a2607d26019f40602dfab5de09716c0d8ee0d38d27f4","observation_id":"af4b3667-a3d1-4b94-ab9e-0f9efcae4f99","resolution":{"observed_at":"2026-05-25T08:05:30.607459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-08-04T18:17:18.089212Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10059","last_updated":"2025-09-12T08:46:49Z","snapshot_observed_at":"2026-08-04T22:46:35.106856Z","submitted_at":"2025-09-12T08:46:49Z","title":"Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T18:17:18.089212Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2509.10059"},"observation_digest":"sha256:bef020a7395c0ebb586b2364f0efce7bcee403f94565b00df8775935b0f613bb","observation_id":"96817b62-3602-4b8e-9c65-4e165c82f11b","resolution":{"observed_at":"2026-08-04T18:17:18.089212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2511.21471","last_updated":"2026-05-07T07:59:46Z","snapshot_observed_at":"2026-08-02T23:27:20.204280Z","submitted_at":"2025-11-26T15:04:18Z","title":"SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-17T04:54:59.903644Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2511.21471"},"observation_digest":"sha256:27eb381c1fe2bbe874f933d0406cc6260432bb422bcb0e878beb699c89143411","observation_id":"0aed436a-99e6-4183-9ff0-fdfcb493c47f","resolution":{"observed_at":"2026-05-17T13:48:49.136768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-08-03T03:37:50.228898Z","title":"Internlm-xcomposer: A vision-language large model for advanced text-image comprehension and composition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07533","last_updated":"2026-06-26T15:22:02Z","snapshot_observed_at":"2026-08-03T03:37:49.338075Z","submitted_at":"2026-02-07T13:09:41Z","title":"Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T03:37:50.228898Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2602.07533"},"observation_digest":"sha256:a2d8b252698eaffa200518bb88317e14a823d363a312cb264d311587f7001ccc","observation_id":"81a8e0c5-e64d-4f5a-8818-d86ef705a326","resolution":{"observed_at":"2026-08-03T03:37:50.228898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-08-02T18:45:58.668589Z","title":"arXiv preprint arXiv:2309.15112 (2023) 18 J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05950","last_updated":"2026-07-30T08:22:34Z","snapshot_observed_at":"2026-08-05T14:33:31.832943Z","submitted_at":"2026-03-06T06:32:57Z","title":"Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T18:45:58.668589Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2603.05950"},"observation_digest":"sha256:65fe151529efc70d9f9ee88a196b222f2e4df6e038809637d78e03206d966191","observation_id":"a0e51aab-85da-467e-848f-b9d5f189b9ce","resolution":{"observed_at":"2026-08-02T18:45:58.668589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2604.10973","last_updated":"2026-04-13T04:21:12Z","snapshot_observed_at":"2026-07-06T22:59:27.499664Z","submitted_at":"2026-04-13T04:21:12Z","title":"CFMS: A Coarse-to-Fine Multimodal Synthesis Framework for Enhanced Tabular Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T16:18:38.658857Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2604.10973"},"observation_digest":"sha256:e040eb135a7fd89821ef1b1bfc74197ffcc2fcee3a528ec236137116f73b431d","observation_id":"a6772b53-7dab-4312-a7c2-a4915253a60e","resolution":{"observed_at":"2026-05-17T13:48:49.136768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:9c2ae6f58b00652107e7782a0c5a10e60d9a93b0d1da894896dd64c9c370f958","observation_id":"9317b03e-b415-4d34-9062-8c89946060ef","resolution":{"observed_at":"2026-05-17T13:48:49.136768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2605.24553","last_updated":"2026-05-23T12:39:37Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:37Z","title":"IQA-Spider: Unifying Multi-Granularity Image Quality Assessment with Reasoning, Grounding and Referring","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T13:28:01.889147Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2605.24553"},"observation_digest":"sha256:62512773215a8fe8049d9ce02ca972574c35c5c265bb2abc036426ea7f8c52a9","observation_id":"d71e3551-5474-4e3b-a7e9-f4a16508c56f","resolution":{"observed_at":"2026-06-30T13:34:40.560924Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2605.31598","last_updated":"2026-05-29T17:59:02Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:59:02Z","title":"Linear Scaling Video VLMs for Long Video Understanding","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-28T23:00:11.246232Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2605.31598"},"observation_digest":"sha256:84a4987e0136fd328bc45f4a99087f55b9420b41a323329ed47fd1fe5b9488c5","observation_id":"f74f03d8-1d1f-4ae4-b059-f053af3e914d","resolution":{"observed_at":"2026-06-28T23:02:46.234160Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2606.17030","last_updated":"2026-06-17T13:54:57Z","snapshot_observed_at":"2026-08-01T21:48:31.832288Z","submitted_at":"2026-06-15T17:52:31Z","title":"Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation","version":3},"reference_index":170,"source":"arxiv_source","source_observed_at":"2026-06-27T04:19:26.332718Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2606.17030"},"observation_digest":"sha256:9241baa97c7f672d42796dbca07606942af88b400e9dd03ff8263e0b64172fa0","observation_id":"d6ba6cb0-0a00-42dc-9558-7ee5b736da93","resolution":{"observed_at":"2026-07-03T17:18:43.799277Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2606.24963","last_updated":"2026-06-23T09:21:54Z","snapshot_observed_at":"2026-07-06T23:59:28.120338Z","submitted_at":"2026-06-23T09:21:54Z","title":"Curvature-Guided Mixing for MLLM Adaptation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T00:42:56.323034Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2606.24963"},"observation_digest":"sha256:bde89b51242bb7b40edf5963f8509e497412758a64357156ddf745de1c162419","observation_id":"c75803fd-d409-4189-81bb-148dcce7a61c","resolution":{"observed_at":"2026-07-04T16:29:56.658035Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-14T03:31:19.309532Z","title":"arXiv:2309.15112 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11738","last_updated":"2026-07-13T16:00:03Z","snapshot_observed_at":"2026-08-02T08:52:21.513313Z","submitted_at":"2026-07-13T16:00:03Z","title":"Qwen-Audio-VAE Technical Report","version":1},"reference_index":183,"source":"arxiv_source","source_observed_at":"2026-07-14T03:31:19.309532Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2607.11738"},"observation_digest":"sha256:b24ad6e40ac871926f7f30e44812d6641b0817b2fca81a33b864baf96e92bedb","observation_id":"75f01b8b-f14a-4cc0-891a-00fd6a4f93d3","resolution":{"observed_at":"2026-07-14T03:31:19.309532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-08-01T13:51:21.256489Z","title":"InternLM-XComposer: A vision- language large model for advanced text-image comprehension and composition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18958","last_updated":"2026-07-21T10:49:29Z","snapshot_observed_at":"2026-08-05T22:24:37.521344Z","submitted_at":"2026-07-21T10:49:29Z","title":"Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T13:51:21.256489Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2607.18958"},"observation_digest":"sha256:047476e046e72ba6befc51283e982842cddef11795806ec8e9dbbf8fc2b3df45","observation_id":"dd65781c-dcdf-4400-a77b-36a2da1576d7","resolution":{"observed_at":"2026-08-01T13:51:21.256489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-08-01T10:20:57.609350Z","title":"arXiv preprint arXiv:2309.15112 , primaryclass =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-03T17:27:48.597044Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:57.609350Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:533635b01a6d3061a6300663c0ec20d6252309d6a1238a8f6f61d07e7f076d2b","observation_id":"0d564aa3-ac52-4aef-b627-9e34a4238f1d","resolution":{"observed_at":"2026-08-01T10:20:57.609350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-31T19:16:58.483265Z","title":"arXiv preprint arXiv:2309.15112 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:58.483265Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:16a54735c7c991f53b7285889a2437e028b24c3815ea9395965898b88cb2c03f","observation_id":"edcfe875-9729-4fd4-b2a6-521312c36c1c","resolution":{"observed_at":"2026-07-31T19:16:58.483265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2309.15112/citation-record","integrity":"/paper/2309.15112/integrity","json":"/paper/2309.15112/citation-record.json","paper":"/paper/2309.15112"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"15887c25-c51f-4381-9fe0-7afe4a3002b7","year":null},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:cec361c7638279856fe6754724d9416f290c7b0fd51924a4f041d73e6dfcf009","observation_id":"979ac81f-b2a3-4aa8-b3d3-7d94597bb6b2","resolution":{"observed_at":"2026-05-17T13:48:49.070679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"1b370a2a-fb0c-43c7-87c5-2ee5a7b8d1f5","year":2015},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:238e424eef8f111ed7e286ae905daf7f21d0cb51b045816d11204438ddaa65d7","observation_id":"1b1e2b18-c99e-4ada-8b85-8b5eaa19535e","resolution":{"observed_at":"2026-05-17T13:48:49.076569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openflamingo: An open- source framework for training large autoregressive vision- language models","venue":null,"work_id":"e7a6d057-b3ee-4171-89e8-73ba48d4a29d","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:3b5b2b40514760a70d1246ea44d2344b813a1a697f6ef6358446127c2312e198","observation_id":"3bc5c20c-2329-487a-861b-bd676c3c15ce","resolution":{"observed_at":"2026-05-17T13:48:49.079472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":"6bae39c3-05dd-4dc6-a806-3ff8fe32dfea","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:167120b1dc4cfa450316c81561e78ee860f0c33ea7b6af782602d37ae3de196d","observation_id":"9a82d99e-7971-4650-b024-a104b019e64b","resolution":{"observed_at":"2026-05-17T13:48:49.082437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Baichuan 2: Open large-scale language models","venue":null,"work_id":"532f87f6-8b4c-47b9-9df3-fb6dfda2b80a","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:5f9d88dea5c1f80eb2e9dbbe5f64b1e46df485c684d56198af44e5ad64408d7c","observation_id":"aa52d3b9-74f2-42d9-8f55-4e4091b28454","resolution":{"observed_at":"2026-05-17T13:48:49.085492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving image generation with better captions","venue":null,"work_id":"126cc7cf-e609-4433-b7ec-d233ccbb2801","year":null},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:2b635891be088775b499217961fb81955ffefe2d0413187251ec06de033a1a71","observation_id":"5d477ac7-8eba-4031-899c-1d6f4b87c53c","resolution":{"observed_at":"2026-05-17T13:48:49.088354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are few-shot learners","venue":null,"work_id":"2a5db736-f895-447b-91e5-aa7d1a0ee097","year":1901},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:95164070e42ba0ef5358d4a2a7d5af5ebe6266e10b6290de5098b4cc924cb1ff","observation_id":"d116c809-d25b-49bf-a958-e8d67c2e2052","resolution":{"observed_at":"2026-05-17T13:48:49.091338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"e41e034f-cdb7-4aad-8301-746ebfd18833","year":2021},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:730171548add009e98d6912053de0821bdeb0c39aacda812a207c3a5f70bb241","observation_id":"bf8ca6a2-fff9-41f2-b001-b7ab7b31bb08","resolution":{"observed_at":"2026-05-17T13:48:49.094827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":"2310.09478","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-07-08T22:35:40.586981Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","venue":"cs.CV","work_id":"fb62cd1b-3991-40be-a987-3cfa5772b5b5","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:431da4d817b1a8deb530e57aa6be1a67275a974cc3a4b9f7da101d796cc31d94","observation_id":"a106cb8b-f31b-4268-ac7e-ebce22e1fe7c","resolution":{"observed_at":"2026-05-17T13:48:48.750356Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic","venue":null,"work_id":"31d928ac-3f36-4a2b-9b84-47952898afd0","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:2ef86f394e13b4db2450be703c868586c4ac03be1383d94c09cc710d3392db26","observation_id":"65bf8951-f540-47ec-aa0a-057bbe4d46ca","resolution":{"observed_at":"2026-05-17T13:48:49.098339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pali-x: On scaling up a multilingual vision and language model","venue":null,"work_id":"7f0f5a29-33f8-46de-975e-8c0ab82fc7d6","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:b7f9f6ef52b17442d19c4cdb0b9f26da6a8a33d97750b12532a24e52206beab4","observation_id":"f2e7a491-8067-46e0-9f26-b3213f1cbe3a","resolution":{"observed_at":"2026-05-17T13:48:49.102232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lawrence Zitnick","venue":null,"work_id":"77d8de7e-818e-4653-a43c-409f7375f037","year":2015},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:2b7004503d8ecee1badb9224e6e34fb03b374ba4f4b2eb1c4d5e9c31d1b20eda","observation_id":"9cc53447-c692-4081-8737-a6fdae6c30c0","resolution":{"observed_at":"2026-05-17T13:48:49.105682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pali-3 vision language models: Smaller, faster, stronger","venue":null,"work_id":"daeec27b-d558-4c26-a513-266d5c34adbf","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:a8b2dd6201d6df4b90747e7e838250adc1dcc34dfe629d65d8a75f10077b9fba","observation_id":"2d8b29a9-5d29-4d34-b425-69f40dfe8730","resolution":{"observed_at":"2026-05-17T13:48:49.109053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pali: A jointly-scaled multilingual language- image model","venue":null,"work_id":"77c55888-e4f2-420f-89a8-58cecf2fce07","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:5d150f9cd61747166af2b117e86a081d563631e2ee29bcf8670ace9be24d7cd9","observation_id":"6628fc6d-209c-40c1-bbd8-a684ded97381","resolution":{"observed_at":"2026-05-17T13:48:49.112834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"0a0ac493-1c68-4626-9549-7ee8ba923833","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:a9d4491a5b378854bd5b23cbc80754bffac1905646d234f4f5a55e6cbbd0583a","observation_id":"240c8446-ec7d-4ee6-a870-8c7a96db8c30","resolution":{"observed_at":"2026-05-17T13:48:49.116256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":"c29797e9-bd3d-424b-9a7a-f2b2a97d0813","year":2022},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:8de83a1ca1bcb96a08081d346bec2d607ab8326e294c6095a1987718f6ca4b8f","observation_id":"9a075ae1-0a14-4d76-aeb2-9436be4f728a","resolution":{"observed_at":"2026-05-17T13:48:49.119703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Class-balanced loss based on effective number of samples","venue":null,"work_id":"d26d2e2d-1296-4377-b020-240a5f417674","year":2019},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:0bb15b2971d6f47db46599a6043b37727aa302153c80374d343006b5401251ef","observation_id":"5e457e9b-7027-4b12-98ca-a56c94fa0d3b","resolution":{"observed_at":"2026-05-17T13:48:49.123240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning, 9","venue":null,"work_id":"a9aaebcf-de69-47bb-9f5b-aa835a18c4a8","year":null},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:10a7e6fd26991fac01a1c47d0cf575fb38cdb460e68f2703e4121c48a775937a","observation_id":"4ccdc6ea-2aaa-438f-a13f-b83c810ac715","resolution":{"observed_at":"2026-05-17T13:48:49.126859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual dialog","venue":null,"work_id":"3fe260b7-2b28-43e9-a58d-e52727031bdd","year":2017},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:ce38e4115416e0b1f4bd3657137d68bb1b53060af61c0f9e1476b423ec72a0e6","observation_id":"9d3a463c-b9f5-4c0e-bd37-b83c5f788c78","resolution":{"observed_at":"2026-05-17T13:48:49.129967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"f331ef51-0577-49ec-bce4-2d1667045f27","year":2009},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:2c31f5143dabd6c31c521e39bc37ad22925672643796c540af35f39e0bdb9c76","observation_id":"2cb3bbd5-a823-4be9-8abb-9f23de587b74","resolution":{"observed_at":"2026-05-17T13:48:49.132759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":"49b79a26-861a-46a8-b255-cb93ad529361","year":2018},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:499b0b08f7922992af842f50deeca7540252dafa1f90b56fb09e96edb52f3f8f","observation_id":"306ad5da-4ad3-4f14-a386-99694741f938","resolution":{"observed_at":"2026-05-17T13:48:49.135664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-07-06T16:21:25.401345Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":"2309.11499","doi":"10.48550/arxiv.2309.11499","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dreamllm: Synergistic multimodal comprehension and creation","venue":"arXiv (Cornell University)","work_id":"43128e8d-8204-43b8-9bfc-f0da0b15ed39","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:13d35cab4b1613efa70e9941fc334af86acc4d986416a011033bfca63f7fb805","observation_id":"8d9f494b-7264-478c-8a43-ee5784727b85","resolution":{"observed_at":"2026-05-17T13:48:48.760046Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:4f43d13551e9689e44cbfcb34dcb833698ee62c1d78b27438ecc94ed350c9037","observation_id":"f0331151-8237-4e7d-9eca-407cad275eaa","resolution":{"observed_at":"2026-05-17T13:48:48.724699Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glm: General language model pretraining with autoregressive blank infilling","venue":null,"work_id":"4dbbff1b-929f-4729-af36-1c3398fae4ab","year":2022},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:77727f0df174e8568e802c99cca10160a507e7cc99acf7b6a58a3e1e47318ace","observation_id":"7bdeef09-6e21-47aa-992a-e417f0ef1e98","resolution":{"observed_at":"2026-05-17T13:48:48.824363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eva: Exploring the limits of masked visual represen- tation learning at scale","venue":null,"work_id":"d4ac84c5-0aba-4588-a4d9-263b5ed2d325","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:76909ccffa2d54a778c7f9915749e128241ae8656e3d591714e55ebec85cf020","observation_id":"c44bc926-145a-4d21-8577-4a85ee158fb9","resolution":{"observed_at":"2026-05-17T13:48:48.828653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:692b0f685164861a1c2a4914d2206692527e09760e473d78589dcfde287f6d3c","observation_id":"0bd4293c-b96c-4cf6-a210-db1a429d4110","resolution":{"observed_at":"2026-05-17T13:48:48.799970Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":"2304.15010","doi":"10.48550/arxiv.2304.15010","metadata_source":"pith","pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","venue":"cs.CV","work_id":"0fe2cfd8-d442-4ceb-b1a9-a465704f39b2","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:ae0293d9991c1a7d974aacc1f193d14fe2dab0a6605819126d4de0cff386f5bf","observation_id":"4942f170-a105-4538-9095-eb8df5913349","resolution":{"observed_at":"2026-05-17T13:48:48.819475Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Planting a seed of vision in large language model","venue":null,"work_id":"70e2f92e-0463-4834-a84e-0b00392ced8b","year":null},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:c76888039b6d9e27afaa0d91a915cb84cdac5b1e43d39a2c66dc0e1e0c71f5a9","observation_id":"aeb05894-a315-4054-8f73-026026ddce2e","resolution":{"observed_at":"2026-05-17T13:48:48.832607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wukong: A 100 million large-scale chinese cross-modal pre-training benchmark","venue":null,"work_id":"0e89477b-c1e8-4bb9-bd5e-3b7057ad5f0a","year":null},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:9d177753e4910cef3afb4a9cb1eb5340059409dbb28d82a43ef7ed6a03945584","observation_id":"d4495152-225e-4c73-aaed-e42d3fb5d321","resolution":{"observed_at":"2026-05-17T13:48:48.836552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10755","last_updated":"2023-09-15T09:52:14Z","snapshot_observed_at":"2026-07-06T16:08:33.160103Z","submitted_at":"2023-08-21T14:40:48Z","title":"WanJuan: A Comprehensive Multimodal Dataset for Advancing English and Chinese Large Models","version":3},"cited_work":{"arxiv_id":"2308.10755","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.10755","snapshot_observed_at":"2026-07-02T22:17:25.674418Z","title":"Wan- juan: A comprehensive multimodal dataset for advancing english and chinese large models","venue":null,"work_id":"9ad40732-9366-4664-8ff4-660de173e5fd","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2308.10755","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:58b2a3a07fc8cf5362284275263e41b839c9fd22766b7f7de8587bd01c7ae82f","observation_id":"ab9cdb45-d6db-471a-8850-4b4cf2a48598","resolution":{"observed_at":"2026-05-17T13:48:48.755358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LoRA: Low-rank adaptation of large language mod- els","venue":null,"work_id":"05630a5a-2886-4be2-a844-07a925c52c9a","year":2022},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:8a359b8cd7c0b0b370215194636efd6f9041865dcfd77b041523bca4011c3d40","observation_id":"42107cc3-71a5-4c4f-8229-5e3c617f39b3","resolution":{"observed_at":"2026-05-17T13:48:48.839983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09936","last_updated":"2023-12-18T04:33:17Z","snapshot_observed_at":"2026-07-06T16:07:57.164115Z","submitted_at":"2023-08-19T07:53:43Z","title":"BLIVA: A Simple Multimodal LLM for Better Handling of Text-Rich Visual Questions","version":3},"cited_work":{"arxiv_id":"2308.09936","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09936","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bliva: A simple multimodal llm for better handling of text-rich visual questions","venue":null,"work_id":"d9a70d96-b1b1-477a-b706-5f54e44c0d5a","year":2024},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2308.09936","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:2b869a3b613ab2bfe6b967367513ed4940151e984df32ca2e87c0a38c3d7810a","observation_id":"b3226ca6-54ca-4841-a2d1-7071849a604a","resolution":{"observed_at":"2026-05-17T13:48:48.789741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reveal: Retrieval-augmented visual- language pre-training with multi-source multimodal knowl- edge memory","venue":null,"work_id":"f664f6af-8fd5-423e-ab4a-8a45690c3f3f","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:48fd94034620a08c3c2512fa40e2d36312c26e8579594a9f10343f92b408fa9e","observation_id":"09f4f62f-9329-470b-b15d-d9690885be80","resolution":{"observed_at":"2026-05-17T13:48:48.843446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"c4f57e47-e227-4e87-85b9-fd1fadb81991","year":2019},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:f60fcce68b015162eb1717de509f9488e43f6baaed4a7b461505eef1d5d1fbc8","observation_id":"35753301-96f4-4cca-a9fe-002ae1d88fcc","resolution":{"observed_at":"2026-05-17T13:48:48.846622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"18152b66-c241-42a6-be37-c239280b7d53","year":2021},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:0bd7742a120b7d80aedf464564a560a8c6b4d3b3225e4eb610b9cf85d36bf55f","observation_id":"c1ad230f-791d-4908-b51e-dc7f69c30460","resolution":{"observed_at":"2026-05-17T13:48:48.849897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"af313737-1517-4271-9631-e9ff7ebfd458","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:c27a7a56d6788a7044627853c09f321769488f226886f4c5ea12d00f88b1310d","observation_id":"c7c10019-60aa-4fd4-9b2e-90bbd3f0ef94","resolution":{"observed_at":"2026-05-17T13:48:48.853045Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding language models to images for multimodal in- puts and outputs","venue":null,"work_id":"bd99bdc6-27ac-4dcc-8d9e-1c5a2d750a8a","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:87ab653a3d42a93c451a0f50c6468b53a2b5dd4ef9da0685d9dd01342bbb0d4b","observation_id":"0013b0c1-fb74-406c-8df2-273eca0d701b","resolution":{"observed_at":"2026-05-17T13:48:48.856390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openassistant conver- sations – democratizing large language model alignment","venue":null,"work_id":"b9111822-4800-4a5f-9b64-5ac44bb46f33","year":null},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:ec6550c89932ccd1e028a4f1d169177950999a7496add8b1119c67dd0514dc73","observation_id":"a6e581ea-b5bf-4ea6-b328-ea90fc000460","resolution":{"observed_at":"2026-05-17T13:48:48.859818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rush, Douwe Kiela, Matthieu Cord, and Victor Sanh","venue":null,"work_id":"1daecf06-5d3f-4053-bb22-05a53e6f1296","year":null},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:db2c0624811b2331ee6a34d92d8eca140605cd9dcc07eb6344f32d0ee2e83dd2","observation_id":"9cceac28-acfe-462d-91c8-b50accb0a360","resolution":{"observed_at":"2026-05-17T13:48:48.862966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Seed-bench: Benchmarking multi- modal llms with generative comprehension","venue":null,"work_id":"3ec4d067-3b10-4ed9-9eca-056c9a8576ce","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:35d92e1c56d76c8a0606aca9ec2908a038ae28876a52a3c1ea7598640363628b","observation_id":"0974ee3a-f490-44d4-b6eb-13bc4942c818","resolution":{"observed_at":"2026-05-17T13:48:48.866507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Otter: A multi-modal model with in-context instruction tuning","venue":null,"work_id":"6259d8a6-8d23-4895-8dca-7c102ae94559","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:160a23bf37bdc8ccb555dc64b17817eea86259b9629fc583ccbb33ecc2e6e61d","observation_id":"53728e28-7a43-4baa-b6a9-8c6360441e7d","resolution":{"observed_at":"2026-05-17T13:48:48.869651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":"2301.12597","doi":"10.48550/arxiv.2301.12597","metadata_source":"pith","pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":"cs.CV","work_id":"63d03f4d-15f4-4583-8286-913c19f02294","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:078191834af21ec6410f002df155eafac102cd1baabd9471f2fc018d3e2315f7","observation_id":"67bebcf0-e3c0-42ab-93c0-b5d0b26c5e44","resolution":{"observed_at":"2026-05-17T13:48:48.719613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":"f5f3b99e-623f-4327-bc82-9a79a9ca4da4","year":2022},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:f2ffa627ce8e4e0cf80290f8278b6955cecaac33443f1a4878f1ed81cba9613e","observation_id":"558b4f9b-ca87-4337-956b-b3a34327e36f","resolution":{"observed_at":"2026-05-17T13:48:48.873220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04152","last_updated":"2024-05-25T14:56:21Z","snapshot_observed_at":"2026-07-31T00:22:45.650811Z","submitted_at":"2023-08-08T09:32:43Z","title":"Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions","version":4},"cited_work":{"arxiv_id":"2308.04152","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.04152","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Empowering vision- language models to follow interleaved vision-language in- structions","venue":null,"work_id":"df862014-cf77-462a-b753-a6d33e56b7fd","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2308.04152","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:904406ab776565d96233da531656a791c4376000a4fbe98d7fa243a2d9cb7ff0","observation_id":"b2a9dea2-6d23-4c30-ae80-9c3a6e17766e","resolution":{"observed_at":"2026-05-17T13:48:48.740728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounded language-image pre-training","venue":null,"work_id":"56afb9f0-15bb-4472-aeab-9417b06b3dc1","year":2022},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:c0673be2a22d303d65fee114016df6f6757c9077ebe0e73c76e867892451f007","observation_id":"0a4a90c5-f97b-4748-bec3-78be7ddde092","resolution":{"observed_at":"2026-05-17T13:48:48.876451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lmeye: An interactive perception network for large language models","venue":null,"work_id":"d50f200a-476a-4820-b14b-04bfaf594cde","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:0554cc171cc5ab31314015a2f88c0f1a39a9ca13dfe61ba24794a9cdb7c36d44","observation_id":"ef49e8f3-1738-457c-bec2-fa450ba70519","resolution":{"observed_at":"2026-05-17T13:48:48.880117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual spatial reasoning","venue":null,"work_id":"3ca26b73-3737-447f-9df8-618d654f842a","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:2854ccca20c35ada5199f4f83e713eb373f9fbeeea920820c196cd1a8c66c283","observation_id":"7c529356-af24-4d2b-a476-bc1d725ceaca","resolution":{"observed_at":"2026-05-17T13:48:48.883041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-07-06T15:46:40.281717Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":"2306.14565","doi":"10.48550/arxiv.2306.14565","metadata_source":"pith","pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","venue":"cs.CV","work_id":"ba8e8164-e47f-42d6-83ad-696cb57ee79a","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:ddf570b192d0655e2749c690c2526bc6e0d531b6a30fa483ac7295e2b9c052fa","observation_id":"1248191f-170f-480f-9ce9-c4c46bdc728f","resolution":{"observed_at":"2026-05-17T13:48:48.764410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2310.03744","doi":"10.48550/arxiv.2310.03744","metadata_source":"pith","pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improved Baselines with Visual Instruction Tuning","venue":"cs.CV","work_id":"5baeaa33-5986-44a3-85a4-fcabd6fc1e8d","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:be98da6c9325c202157e8e39b86c2d435c78361aedbafd75e87a68678679ea6c","observation_id":"7dddacd5-b221-4ede-87c6-825736dfc500","resolution":{"observed_at":"2026-05-17T13:48:48.778256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"59ac12d9-83e3-46e6-9bf0-3a5c66bf79b6","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:8b09c38a8cae0e5fe3ad97407d3108c9703cc1e180ac3ed855a731d3cfb34be6","observation_id":"1bc0adf0-50ed-440c-bf6c-a27fddaf0053","resolution":{"observed_at":"2026-05-17T13:48:48.886464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"20f26e9a-72c7-48b3-9b2d-b9a162278f62","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:bb695955da00e650bba7b5fd71c240779505a0be3a4b2bdffa16529af4d48189","observation_id":"deb96abc-cb5f-4a0a-92fb-4568e4db9f58","resolution":{"observed_at":"2026-05-17T13:48:48.889874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":"2307.06281","doi":"10.48550/arxiv.2307.06281","metadata_source":"pith","pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","venue":"cs.CV","work_id":"3b44943d-0f15-4228-9ac3-0e376f4f9ada","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:75850f01c0f1999d13a9cfa535092abacb133d0ee2176b8681cccb6ea324114c","observation_id":"abb5e0db-e7f9-471f-8b44-807025396787","resolution":{"observed_at":"2026-05-17T13:48:48.805997Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taisu: A 166m large-scale high-quality dataset for chinese vision-language pre-training","venue":null,"work_id":"9f1e607c-eecb-4830-9548-d9edc163f068","year":2022},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:ac2d45f1c6d760501b973918ac3c3b6b57f26fd99f8086883f2f5bd8265ff5d5","observation_id":"483b757c-3531-486e-b552-d69b1503a51d","resolution":{"observed_at":"2026-05-17T13:48:48.893018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4f5b2c4f-31e0-46d9-88f4-147b4e6b9cd4","year":2019},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:af36c51ffe9a549ef3d755c7e0ac843185af217f42d98cab961b45e4d0b3dcc0","observation_id":"7ff8e631-72c4-41b7-bf1a-1517384975c4","resolution":{"observed_at":"2026-05-17T13:48:48.896093Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn to explain: Multimodal rea- soning via thought chains for science question answer- ing","venue":null,"work_id":"1fa2f4dd-0849-4c2c-9706-9c291f1f8a3a","year":2022},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:cadc25382c753d0591e8006d7dc09fe12b8aaefa91acaa67c69bbab7eaa20acd","observation_id":"094cfbac-c5c1-4a97-975b-72624e879d10","resolution":{"observed_at":"2026-05-17T13:48:48.899868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13214","last_updated":"2022-07-25T04:05:29Z","snapshot_observed_at":"2026-08-02T20:16:21.986025Z","submitted_at":"2021-10-25T18:52:26Z","title":"IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning","version":4},"cited_work":{"arxiv_id":"2110.13214","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.13214","snapshot_observed_at":"2026-07-10T11:37:03.154319Z","title":"Iconqa: A new benchmark for abstract diagram understanding and visual language reasoning","venue":"cs.CV","work_id":"e5046a8f-5c72-46fd-baba-98ea6bce6d5a","year":2021},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2110.13214","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:747918b906c0a538fb842448a27646b221627d611b4214f8d51b4490567ec92b","observation_id":"de83e9c4-7deb-44e2-a114-bb3af54e26bf","resolution":{"observed_at":"2026-05-17T13:48:48.735693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"7b807e66-73df-4250-8d0c-64f04ac35f95","year":2019},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:04f0076448022fe0391e236e0c286dcc6c06eae6636e564fe8aab7669d1d2a3d","observation_id":"b6a51c30-603b-4857-b1ab-59ecb00fced3","resolution":{"observed_at":"2026-05-17T13:48:48.903761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"d371edbf-b28b-489f-91d6-b046e62b0f7b","year":2019},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:bb8bb7998b3779754102f514869c12e62fdb96247336e446a5974e0400692a5e","observation_id":"1357f108-2ed9-47a6-8d0c-b207cd649896","resolution":{"observed_at":"2026-05-17T13:48:48.907186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Power laws, pareto distributions and zipf’s law","venue":null,"work_id":"1b9bb39b-5501-4204-bd5c-60d04d9d210a","year":2005},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:f0606e8708f24c5d02ee012fa7db15a2f7d70d6b3de7a81a91d9c21c07c3a463","observation_id":"714a7a29-c6bb-4a50-9371-9194d5c3d40c","resolution":{"observed_at":"2026-05-17T13:48:48.910454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"941c322e-bb87-43d5-afba-1fe61b6f1785","year":2022},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:cc4af32e12d2102497c4b8ff830927eaf9ed47455796122c26b55dc5f00de8a9","observation_id":"12b653c1-7f5d-416f-bbe2-d40020490428","resolution":{"observed_at":"2026-05-17T13:48:48.913531Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4 technical report","venue":null,"work_id":"7704f767-90df-4b1a-a568-85f27b998874","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:19b523d5ae40c6907cf7668b27fe8986ccc9a142e30d62db92ed37bfa5096b91","observation_id":"52812451-604e-4259-b71c-827a21b764d5","resolution":{"observed_at":"2026-05-17T13:48:48.916089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4ba45f1b-bdba-404b-ad0b-de05dba1d6ce","year":2011},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:a97cca24091e38ec6be9298724c683d652f05298c8876168268c45854142cd86","observation_id":"f02c3809-f14c-47e4-aa04-c1c94118f8ec","resolution":{"observed_at":"2026-05-17T13:48:48.919192Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feed- back","venue":null,"work_id":"3db4005a-e372-46ba-8ae9-6d92a3d326d2","year":2022},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:0f9705e18955afdcbc9b520774778dca6eeb189dd6673be9a3961fcad06ee8d6","observation_id":"0fc9a6b4-8aae-4488-867b-2e1d54aae0a7","resolution":{"observed_at":"2026-05-17T13:48:48.922532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The refinedweb dataset for falcon llm: Outperforming curated corpora with web data, and web data only","venue":null,"work_id":"d7467c70-546c-417d-bdfb-b0c65f2fa167","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:d407ff251c473021fc2618be5a7ffe3accd02b0c4236b6ecc5d2911f866e070b","observation_id":"c3a2911f-3b2b-4a1d-a5c9-9bcdacfcf6e1","resolution":{"observed_at":"2026-05-17T13:48:48.925958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kosmos-2: Grounding multimodal large language models to the world","venue":null,"work_id":"b3604277-d905-4027-a842-439b68aa7034","year":null},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:968bcc22119c9984d3b0ec56b713400be2a08e067335295ea5e7477a412f0a5b","observation_id":"0fd2ac72-cec9-4eb9-a53e-584430c1c59b","resolution":{"observed_at":"2026-05-17T13:48:48.929741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing qwen-7b: Open foundation and human- aligned models (of the state-of-the-arts)","venue":null,"work_id":"0adc3399-0fd3-4f05-a3a9-63637ed5877f","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:20f4f01f3a2e98e93fbeff5687bbb21bf07cdfde33ce7d132706526663ad8d1b","observation_id":"c661bb59-eb20-409e-9679-8dd8da5118eb","resolution":{"observed_at":"2026-05-17T13:48:48.932885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"e47152ca-2f59-467b-b07c-cc9aa4fed06b","year":2021},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:3cbb6f69cee330d5c7366b8202723cb7d4793f8b3471f552ed25e3e4e5647028","observation_id":"95025b0e-807f-43d9-abcf-7f0912bd15d1","resolution":{"observed_at":"2026-05-17T13:48:48.936067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving language understanding by gen- erative pre-training","venue":null,"work_id":"0e7bc8e0-2a8d-43a3-bf91-443f27b723d2","year":2018},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:1fab65bc31391d5e09ecdedb919d7baa38080ca542d925094a79119a11dc7df2","observation_id":"6f3897a2-8273-43ee-af0c-2d62ef8fbcad","resolution":{"observed_at":"2026-05-17T13:48:48.939311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"5b184514-8ddc-4f6f-a618-55c515d138a8","year":2020},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:fc3546a78239cc1493f4eaf63d3a2179500995178269f16db9e8f048e3f4b1de","observation_id":"5c9e6575-d48c-491e-8772-dd8e9a7a56a9","resolution":{"observed_at":"2026-05-17T13:48:48.942400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":"6a137c3f-a416-48c0-81da-3366d836aad9","year":null},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:87d606470c3da2f9916c01e0a7e55f1d7a13865fe4d867986d1b62b4575dae8d","observation_id":"26d41905-6dae-45eb-a36f-e7390fefbe9b","resolution":{"observed_at":"2026-05-17T13:48:48.945540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"43dd787d-2948-4f82-96ea-bb394c078eb8","year":2021},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:118de1b378593d49ac2ce7dc497b802e531704286363e86945f8b4c455cb8038","observation_id":"6ffd6cc8-9a02-4299-8865-b0c0d8661940","resolution":{"observed_at":"2026-05-17T13:48:48.948395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"5249636e-4fcc-4133-945c-5dcfbda1cae7","year":2022},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:455be65b402fa97b640bdeb79798660974ef252f5109a099b86aa75c1ac9426b","observation_id":"aa31804e-c4bb-4990-b58e-acccba4a8a2d","resolution":{"observed_at":"2026-05-17T13:48:48.951146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"d3f13ff1-8a47-4427-80ca-09561e3e9026","year":null},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:d14b4bc96147e72c4a031a2ff63c20bfa6d462e06f9d59ebb24d6ed0bdc3fcf9","observation_id":"01fee63c-ca7c-46e3-9cf4-1104040ff200","resolution":{"observed_at":"2026-05-17T13:48:48.954258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laion-5b: An open large-scale dataset for train- ing next generation image-text models","venue":null,"work_id":"94aafbe5-d12e-4f3d-9812-d3dc02366279","year":2022},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:ccdc7c60bdb7737d311bfde44aefe39e7eee3d3e3c4423524d3fc28e46bb343c","observation_id":"66fd9a01-8951-4007-b3b0-50a8d000ed2c","resolution":{"observed_at":"2026-05-17T13:48:48.957596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":"2111.02114","doi":"10.48550/arxiv.2111.02114","metadata_source":"pith","pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","venue":"cs.CV","work_id":"fbf16034-512e-4dd9-a0bd-7ddd23f532a6","year":2021},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:1e1664064ab922a92ca419f3d3db126b12fa3790872318adb40ec3924663919a","observation_id":"8bbedc54-57b5-4c8b-a0a6-e79a7a281bfa","resolution":{"observed_at":"2026-05-17T13:48:48.773235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":"44275059-6bee-4422-94be-dd9846e90049","year":2022},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:462c31da288a1c96551b47773b2c4ac33880c55efcba925b733ccbf6513a4fdc","observation_id":"af4f7762-243c-4e28-823a-00c59e6c54ac","resolution":{"observed_at":"2026-05-17T13:48:48.960728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03729","last_updated":"2024-08-10T08:51:58Z","snapshot_observed_at":"2026-07-06T16:03:30.529010Z","submitted_at":"2023-08-07T17:17:05Z","title":"TinyLVLM-eHub: Towards Comprehensive and Efficient Evaluation for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2308.03729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.03729","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tiny lvlm-ehub: Early multimodal experiments with bard","venue":null,"work_id":"39a49e03-c034-4556-8a27-8ded3e1ca59d","year":null},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2308.03729","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:69d709bde5a490d728320437056c0c1c4c97e70ae4a60799f4ba7b2ffd89589d","observation_id":"55885b6a-4cd0-4fd8-aa7f-2329eabc3bdb","resolution":{"observed_at":"2026-05-17T13:48:48.783620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":"077e8374-53d0-4595-b48d-592f578c1e5e","year":2018},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:5372535da11986ff1c62ba1287f08ae0a61b3ba62ea6f685e3ebe502df0127f2","observation_id":"a75387cf-17ef-4b96-ab27-3fbe80b31663","resolution":{"observed_at":"2026-05-17T13:48:48.963747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Textcaps: a dataset for image caption- ing with reading comprehension","venue":null,"work_id":"3572e46d-d560-4ebe-a3ea-aaf57a629aad","year":2020},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:7269d934c4ae8e98e90e9c351ac0fc9850334f569d1da9d19d9c4e1a8261e42b","observation_id":"28a41c36-b47a-42c0-8474-930611cd9e8a","resolution":{"observed_at":"2026-05-17T13:48:48.967061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards vqa models that can read","venue":null,"work_id":"674fa5d3-2c7a-4ec3-ac1c-630ab57982d1","year":2019},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:432332b916b9fdd5ae531d6c368c16abe2f5190c38fe9c10bb8938893be92fe5","observation_id":"0c7632a7-ec81-49e4-8764-a1c8ded7ebd0","resolution":{"observed_at":"2026-05-17T13:48:48.969975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wit: Wikipedia-based im- age text dataset for multimodal multilingual machine learn- ing","venue":null,"work_id":"543e32c5-5023-4105-85e2-f2ef2944fe2c","year":2021},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:b0152779f6a475c8bb392899a8cdb5bd7b83e40525ae9ea63d808849595c0dc2","observation_id":"4fc8839e-b62a-4758-a16a-a5bd277471ad","resolution":{"observed_at":"2026-05-17T13:48:48.972950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative pretraining in mul- timodality","venue":null,"work_id":"9b17408e-b3c1-4b93-a3f4-4cc496f067b2","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:4491cced7f50da236ccc65ac188364f8307e36c626073650a9b9626b69dd5ae7","observation_id":"13b1b070-5143-4668-9232-24ffe6aedb14","resolution":{"observed_at":"2026-05-17T13:48:48.975697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hashimoto","venue":null,"work_id":"4eee3520-cc00-431b-bab2-28a01f53236c","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:3408939caf2dd41099203d81114bc5e945fa4d75abb370e77e2d52c4c6a97f54","observation_id":"e58cdb82-0f2b-43e1-b65a-7f6731ad4bd6","resolution":{"observed_at":"2026-05-17T13:48:48.978299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internlm: A multilingual language model with progressively enhanced capabilities","venue":null,"work_id":"5d042552-c567-49f9-bc9a-02ad472dd4b7","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:98b0367f98a13ae964f1fd63b512bd904d382d7cc748dd5bcd43e740d0a80b50","observation_id":"1d3a0a36-a199-4142-b6a0-16975e15de1a","resolution":{"observed_at":"2026-05-17T13:48:48.981540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama: Open and efficient foundation language mod- els","venue":null,"work_id":"d314207f-9686-4fc4-9bfb-cf46f39d136b","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:fd6183adf4f3333d44c64d3c4d92133776ae58b832488f6a3c13484e7e3d485d","observation_id":"f680910f-12db-4574-a02e-c04fb73f51a5","resolution":{"observed_at":"2026-05-17T13:48:48.984344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":"74de2730-f1ce-4d17-9c16-fb20e3bd0528","year":null},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:da75799855593edaedd32225e19a6c4898ea4849233bda332aa5d188872b5ee5","observation_id":"030b4e6a-a13f-45ab-bdb6-60ceca6f301e","resolution":{"observed_at":"2026-05-17T13:48:48.987669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"670bef5f-aea3-4c5d-a2e0-10ad33418a4e","year":null},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:0ecc296f86260fc4f749e0945335d5d4b8d28709dcd13df896c26de57349950b","observation_id":"d68bd975-71a9-4908-a508-5a9c359f40a6","resolution":{"observed_at":"2026-05-17T13:48:48.990812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vigc: Visual instruction generation and correc- tion","venue":null,"work_id":"c8e0e330-56d0-4a3a-8e0b-0ae45950a597","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:c757fbd36c5fe4e0112eb98861b2cc9102cc86ca7fb1ea35b51085218477c265","observation_id":"76633ef0-68dc-4d2b-b1ae-b20a5ac33c0c","resolution":{"observed_at":"2026-05-17T13:48:48.993773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":"fc4615e7-cba5-459b-861d-9614938a2b87","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:16fee1ad0a6c812e55fbc155d12e7b34fb8f9100801afff34c22f50c77b4462d","observation_id":"bacd1d0f-f64f-4c71-b0c3-6135f6b76ea4","resolution":{"observed_at":"2026-05-17T13:48:48.996855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14181","last_updated":"2024-01-01T14:48:48Z","snapshot_observed_at":"2026-07-06T16:23:18.453624Z","submitted_at":"2023-09-25T14:43:43Z","title":"Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision","version":3},"cited_work":{"arxiv_id":"2309.14181","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.14181","snapshot_observed_at":"2026-06-30T13:34:40.544825Z","title":"Q-bench: A benchmark for general-purpose foundation models on low-level vision","venue":null,"work_id":"5cc0bbca-7cce-4f8c-bd9d-7b44a68d9062","year":2024},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2309.14181","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:c2a3b3244e7c1aaf879d88a13cfb08d9a65c2b52282b8c99973701b110f61398","observation_id":"ed5a36fc-22a4-429b-8d46-d70709c2e554","resolution":{"observed_at":"2026-05-17T13:48:48.768680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lvlm-ehub: A comprehensive evaluation benchmark for large vision-language models","venue":null,"work_id":"825889a6-99bb-4af6-8111-7cdec3dca933","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:4527c84cc44e5f492ad5ff9173e21164c5ef476fb185219a70814aba855bdfd4","observation_id":"65a556fd-8bd7-4d22-b4c9-0cf6d7491027","resolution":{"observed_at":"2026-05-17T13:48:48.999879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chinese clip: Con- trastive vision-language pretraining in chinese","venue":null,"work_id":"dea8cf55-e8a7-4b11-bcae-79cfe348a43a","year":null},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:39c459625c2c6affcd6f0a42ac193e1f057157b2ae8724560e7937d5477e82cd","observation_id":"c26c6150-1754-4a06-825a-d71e26062f6c","resolution":{"observed_at":"2026-05-17T13:48:49.002905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retrieval-augmented multimodal language modeling","venue":null,"work_id":"05175fe1-1f04-48fd-a89e-723d984dbaa3","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:c5997066cf0e9490f40688fb1e0cd0f97ab16936e498ac39cece2584b8b309ce","observation_id":"a1872810-2a25-4109-8b6d-c170ea82e671","resolution":{"observed_at":"2026-05-17T13:48:49.006024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"mplug-owl: Modularization empowers 12 large language models with multimodality.arXiv.org","venue":null,"work_id":"6807b014-9834-4fc1-8646-beed76288675","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:2c5d623092b3c11367e1bc1df318e50f065265fb8f6c11186d2621553c7a582d","observation_id":"6c67a29b-7c48-4e89-a9c4-13ae1b736c24","resolution":{"observed_at":"2026-05-17T13:48:49.009201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2306.13549","doi":"10.48550/arxiv.2306.13549","metadata_source":"pith","pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Multimodal Large Language Models","venue":"cs.CV","work_id":"29d41a4d-d51b-4020-8947-991367e75c2c","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:63054be6bbe3de0c1241f04268ff55e3e8f1af5c2e6f5670f3f83cd3c71237ed","observation_id":"8156aee6-b513-4fed-bda0-b098f66b8abe","resolution":{"observed_at":"2026-05-17T13:48:48.794372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling autoregressive multi-modal models: Pretraining and instruction tuning","venue":null,"work_id":"979b1a41-15a6-43d6-8175-5b75c53ca778","year":null},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:fca6e9071c4e99f1b3c28e5d0c3ceef31ae5749e2b748eef133367a1843cf442","observation_id":"ce49f9a2-afe8-4249-888b-db8cd7fea919","resolution":{"observed_at":"2026-05-17T13:48:49.012635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GLM-130b: An open bilingual pre- trained model","venue":null,"work_id":"60a68952-cc70-4692-a18a-6ee393b9aa99","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:d08ce7f6c66bb793db01ab4c8eb6a2ef00f6998aff23445bae4529be8c744424","observation_id":"8d5e6de5-c702-4abb-ae5b-0b20d0883147","resolution":{"observed_at":"2026-05-17T13:48:49.015632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02469","last_updated":"2023-07-30T13:20:39Z","snapshot_observed_at":"2026-08-05T18:01:35.670542Z","submitted_at":"2023-07-05T17:44:28Z","title":"What Matters in Training a GPT4-Style Language Model with Multimodal Inputs?","version":2},"cited_work":{"arxiv_id":"2307.02469","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02469","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What matters in training a gpt4-style language model with multi- modal inputs? ArXiv, abs/2307.02469","venue":null,"work_id":"0ca2bbbf-940f-4625-af5f-1770b416694c","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2307.02469","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:eb3aeda9a635214a415bee58e88ba8f1232df611f547cc0fe26b961d5724b0ac","observation_id":"5e3faddd-0351-409c-b533-c105526e204d","resolution":{"observed_at":"2026-05-17T13:48:48.813327Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glipv2: Unifying localization and vision-language understanding","venue":null,"work_id":"f208744f-5c50-4785-9cf9-1140fcd1ce7e","year":2022},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:289f069daa5f122692a3ff22c751d3107052a28720d514cd58b6732292e60b9f","observation_id":"fa1c1330-c9f8-4663-9329-352b5b999808","resolution":{"observed_at":"2026-05-17T13:48:49.018756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":"ff7723e8-0673-46ed-a5de-b9ee904d11fe","year":2022},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:a93ef105d82c3ff7aff531873201ec15bb3e2ad21ff1a959a1db2884ae1ef8cd","observation_id":"aaba5360-a328-4f28-97bb-814f6f1be40a","resolution":{"observed_at":"2026-05-17T13:48:49.021637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":4,"verified_exact":17,"verified_fuzzy":78},"total_outbound_references":119},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 119 outbound references and 34 inbound Pith citation observations for arXiv:2309.15112."}