{"as_of":"2026-08-05T13:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ae398b429bb6074a06e944f2f002583fffede661d5fb53e9cb5042055c04374","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T03:18:51.582340Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:55:55.637449Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T06:39:37.569021Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T20:25:33.854923Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2306.13394"},"observation_digest":"sha256:a2cf3cef56d4bf60651f4be07e58577d3a722190ca8c658cd16255b8b90044e3","observation_id":"c720735b-edf2-4085-87db-a7b5e3bcc50f","resolution":{"observed_at":"2026-05-18T03:18:51.946750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T17:20:53.687692Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2307.06281"},"observation_digest":"sha256:068580dcc3bd29743ab736da7270a7ced6ec68896c277efdc2c062b302f7e297","observation_id":"86566b5b-222c-4cfb-8475-21b98c56d9f4","resolution":{"observed_at":"2026-05-18T03:18:51.946750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:1d656c56bc1b8e87ea35a1bb1d8295940d861870a0a8e3df9dd8193aad2b8898","observation_id":"176fbb6b-ee30-4a1c-80a2-e6bf6a6721d7","resolution":{"observed_at":"2026-05-18T03:18:51.946750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-15T05:37:41.401736Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2311.16502"},"observation_digest":"sha256:4c2224c7c63af40196d1043a7521b83244a4552b214d8ce5ba3dbb48946be233","observation_id":"77838a10-3067-4695-ab75-e857e2e36946","resolution":{"observed_at":"2026-05-18T03:18:51.946750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T00:19:27.965902Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2401.16158"},"observation_digest":"sha256:f7349b86ea634daa670a3426d3f3b8c9170ba4ea45c45c293bf9a4ec5870a819","observation_id":"74aa7ba5-e508-4027-8609-6a373889c352","resolution":{"observed_at":"2026-05-18T03:18:51.946750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":125,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:8e6fc01f90ac0a73f772026795f922e5c3c4df3c56372e0e8ca96e7bebf4a833","observation_id":"15bd591b-ad1d-46be-b116-789496e35c97","resolution":{"observed_at":"2026-05-18T03:18:51.946750Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-05-12T20:58:58.849040Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2404.16821"},"observation_digest":"sha256:f720afddb38d233ebb7af49c81fee1cde43d4a96a9b79e5152baddb9fa1b92fa","observation_id":"5d51d752-3267-4779-abed-cab4a8de5409","resolution":{"observed_at":"2026-05-18T03:18:51.946750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-05T02:45:38.008864Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"reference_index":189,"source":"pdf_text","source_observed_at":"2026-05-11T12:33:32.631346Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2404.18930"},"observation_digest":"sha256:06aae43ee69e1ce5adb1707259742dd7ebe1c86f80873e2379699d0c9c16bc4d","observation_id":"724b22dc-be35-4f0b-929c-96a9e7d3ea53","resolution":{"observed_at":"2026-05-18T03:18:51.946750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2406.10185","last_updated":"2026-04-27T07:59:24Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:14:22Z","title":"Detecting and Evaluating Medical Hallucinations in Large Vision Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T23:55:57.103971Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2406.10185"},"observation_digest":"sha256:d94b4db11e3e5fb294071042175c0e31dbf687c6698489b3a10ed5cbf36978e4","observation_id":"4232900f-91e2-49fc-9527-e3c9a2d30a05","resolution":{"observed_at":"2026-05-23T23:58:39.595999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-14T00:51:48.163349Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2409.02813"},"observation_digest":"sha256:b4aac010d75122aff72f44ad035f5c9b35b1d1c7a7fb50ca329c0db2cd1f19e8","observation_id":"d364d906-c976-4e03-99ba-c89be89abf89","resolution":{"observed_at":"2026-05-18T03:18:51.946750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2411.16771","last_updated":"2026-04-23T13:21:19Z","snapshot_observed_at":"2026-08-02T03:20:43.405143Z","submitted_at":"2024-11-25T06:17:23Z","title":"VidHal: Benchmarking Temporal Hallucinations in Vision LLMs","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-23T16:57:12.821916Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2411.16771"},"observation_digest":"sha256:0bd44788eba0274b8261e8728ae40b9f8fdee86ea296b790d0f45427f8ac46f0","observation_id":"0297dbd4-e743-4d32-8608-ca401d71eec5","resolution":{"observed_at":"2026-05-23T16:58:12.153327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":276,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:afee8ba41cb6847cfade72f3fb8943653e3d1e419cbb024c1405b72d600a0573","observation_id":"03b48de3-3b9a-4b9f-a672-fbc1e5b13f38","resolution":{"observed_at":"2026-05-18T03:18:51.946750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-23T02:25:04.405036Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2502.13923"},"observation_digest":"sha256:6ef22dfe62d6ab4c90e2c9b69b13a5026ecbe07615263f8b9844ec22567ab269","observation_id":"b0f5dcfb-043e-4bf3-9dd1-6181e967d880","resolution":{"observed_at":"2026-05-23T02:25:19.057831Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:8d05c4ac09990d77bd0e5cc85caa3498359f9204cf0fc943b27a386af795f1ff","observation_id":"1265ab54-13b9-47eb-b30b-ae6965dc4041","resolution":{"observed_at":"2026-05-18T03:18:51.946750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"reference_index":166,"source":"pdf_text","source_observed_at":"2026-05-10T11:58:58.660564Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2508.18265"},"observation_digest":"sha256:e45ce908670c97e77540e705624bf14606b9981d75a3befcaa109f2dd414cd8b","observation_id":"a28beb4c-f76f-4ec7-a2c7-82d2cb6444bf","resolution":{"observed_at":"2026-05-18T03:18:51.946750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-08-05T10:55:55.637449Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03494","last_updated":"2025-09-06T16:31:33Z","snapshot_observed_at":"2026-08-05T10:55:54.406857Z","submitted_at":"2025-09-03T17:23:24Z","title":"Parameter-Efficient Adaptation of mPLUG-Owl2 via Pixel-Level Visual Prompts for NR-IQA","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T10:55:55.637449Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2509.03494"},"observation_digest":"sha256:a183bc9373d4e73b3b7ee2f4b46a3ed8823933c4838941e947f54f51d3091d8e","observation_id":"98d6f1f5-70c9-4e02-80d5-f8a463baf381","resolution":{"observed_at":"2026-08-05T10:55:55.637449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2604.10971","last_updated":"2026-04-13T04:14:56Z","snapshot_observed_at":"2026-08-03T03:27:58.842919Z","submitted_at":"2026-04-13T04:14:56Z","title":"MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T15:51:31.394779Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2604.10971"},"observation_digest":"sha256:2c19545b9cfda8f1faa882d39fe745da36a5ed2205df0c9c2ed7276a5e43fe61","observation_id":"249f0c18-328e-4706-a150-e7c42a0b3163","resolution":{"observed_at":"2026-05-18T03:18:51.946750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2604.12508","last_updated":"2026-04-14T09:32:13Z","snapshot_observed_at":"2026-07-30T19:37:58.552302Z","submitted_at":"2026-04-14T09:32:13Z","title":"From Attenuation to Attention: Variational Information Flow Manipulation for Fine-Grained Visual Perception","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T15:25:46.990772Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2604.12508"},"observation_digest":"sha256:ec65c57429a3ac7ddebca74b6571f438c9efe9e51101de5d7efbdd820e41522e","observation_id":"71c0aba1-8f21-4af8-b5e2-ca6021598b25","resolution":{"observed_at":"2026-05-18T03:18:51.946750Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2604.20366","last_updated":"2026-04-22T09:02:17Z","snapshot_observed_at":"2026-07-06T23:06:49.210284Z","submitted_at":"2026-04-22T09:02:17Z","title":"Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation","version":1},"reference_index":136,"source":"arxiv_source","source_observed_at":"2026-05-10T00:33:39.960170Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2604.20366"},"observation_digest":"sha256:1a7a0097d42df76363f5bda28aab5651ecc8b4245928cf0054801f6c80b63dec","observation_id":"b7aec3d1-05ed-4b01-934e-e0a5e2ed6045","resolution":{"observed_at":"2026-05-18T03:18:51.946750Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2605.10582","last_updated":"2026-05-11T13:54:26Z","snapshot_observed_at":"2026-07-06T23:22:32.858399Z","submitted_at":"2026-05-11T13:54:26Z","title":"Guaranteed Jailbreaking Defense via Disrupt-and-Rectify Smoothing","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-12T04:50:08.866969Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2605.10582"},"observation_digest":"sha256:06d8bfc5341ef5504e2fe9e961c8928523fce082a7823936419df2fec23632c4","observation_id":"28979578-b0f6-4c53-bb45-ade7405486a7","resolution":{"observed_at":"2026-05-18T03:18:51.946750Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2606.17030","last_updated":"2026-06-17T13:54:57Z","snapshot_observed_at":"2026-08-01T21:48:31.832288Z","submitted_at":"2026-06-15T17:52:31Z","title":"Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation","version":3},"reference_index":168,"source":"arxiv_source","source_observed_at":"2026-06-27T04:19:26.332718Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2606.17030"},"observation_digest":"sha256:bdd0ce40e4be5fa3da292ba36420a3567e8a526a8b42665558930008df84705b","observation_id":"3349ccc7-1b8b-4a25-9b6a-e76b8a020c3d","resolution":{"observed_at":"2026-07-03T17:18:44.000141Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-07-06T23:56:40.795364Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":234,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:2a5f50204821a5011fc41b6ad8768a56ba85a5debd0b37fa9cbae89a867237aa","observation_id":"08253312-f120-4863-b5ed-e4ae3fdcce76","resolution":{"observed_at":"2026-07-04T06:39:37.570172Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2606.29805","last_updated":"2026-06-30T14:53:46Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T05:33:22Z","title":"Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-30T06:13:11.013395Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2606.29805"},"observation_digest":"sha256:5324bafe2f50bfa2ff43a5216edf0c4ac76978df5c7dbee5902da098bed6ed84","observation_id":"c8fe25bd-83ba-40eb-b1ec-c57bb2d6184c","resolution":{"observed_at":"2026-06-30T06:14:18.740368Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2606.29805","last_updated":"2026-06-30T14:53:46Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T05:33:22Z","title":"Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-01T07:01:26.911110Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2606.29805"},"observation_digest":"sha256:46f2f87a771d6a73e433374bb41aff5eb72396fdb739ecc1a353afd396549d43","observation_id":"4e66300e-43c7-4670-bcf5-881d882097a8","resolution":{"observed_at":"2026-07-01T07:05:28.622861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-14T03:31:19.309532Z","title":"arXiv:2311.04257 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11738","last_updated":"2026-07-13T16:00:03Z","snapshot_observed_at":"2026-08-02T08:52:21.513313Z","submitted_at":"2026-07-13T16:00:03Z","title":"Qwen-Audio-VAE Technical Report","version":1},"reference_index":181,"source":"arxiv_source","source_observed_at":"2026-07-14T03:31:19.309532Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2607.11738"},"observation_digest":"sha256:a356769bc2fe6ff8e69db6b86ac439cbeb1063d6c3f8357571a4d4bce51daf55","observation_id":"1aaf88b7-bedb-42e7-8b3a-51431da31c21","resolution":{"observed_at":"2026-07-14T03:31:19.309532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-08-01T12:40:56.954792Z","title":"arXiv preprint arXiv:2311.04257","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26596","last_updated":"2026-07-29T08:16:28Z","snapshot_observed_at":"2026-08-05T01:06:18.173042Z","submitted_at":"2026-07-29T08:16:28Z","title":"Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T12:40:56.954792Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2607.26596"},"observation_digest":"sha256:78451660ecc476f11721d837582abcfdbb25aeeede93dcb75acf0c64ed177448","observation_id":"abbab7a4-eef6-4abe-8d74-a2efe25f6549","resolution":{"observed_at":"2026-08-01T12:40:56.954792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.04257/citation-record","integrity":"/paper/2311.04257/integrity","json":"/paper/2311.04257/citation-record.json","paper":"/paper/2311.04257"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"http://sharegpt.com","venue":null,"work_id":"a10cee11-edec-49cc-ab35-9cc7d727ad06","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:118dc77ac5fb07af1605b064a374154d86670fe431118eb784a06c5639612a1e","observation_id":"dabf9d8a-4d5a-42e2-b1ba-c0a29fdd05f0","resolution":{"observed_at":"2026-05-18T03:18:51.887484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning.Advances in Neural Information Processing Systems, 35:23716–23736","venue":null,"work_id":"bb8f1e74-4594-4917-9ca6-659e49ced632","year":null},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:6551b29f778ffdee7b1cce1985eb8781ee3f283a9f535628af755046604481a2","observation_id":"7ffc64e1-5a3f-42c7-a32c-3669cca1f861","resolution":{"observed_at":"2026-05-18T03:18:51.849222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2308.01390","doi":"10.48550/arxiv.2308.01390","metadata_source":"pith","pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","venue":"cs.CV","work_id":"87bfa84a-e663-4165-806f-93ef439d88d0","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:f065bac0dee4b62293b528f13934ed4e7b35f03a1f93896a6e37de3eff3b95c8","observation_id":"4ac22e38-c165-4d77-b5f3-35bbba7c2251","resolution":{"observed_at":"2026-05-18T03:18:51.806210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":"1607.06450","doi":"10.1007/978-3-319-32025-0","metadata_source":"pith","pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Layer Normalization","venue":"stat.ML","work_id":"20a2d720-0046-4c7c-bcd6-327ec8143f69","year":2016},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:cfa70bc9ea20a7d062e5732dcf99f4adc3dd89a8fcaa5ca019661388d06c9565","observation_id":"51e9787a-644c-486e-9945-12d980ea1d67","resolution":{"observed_at":"2026-05-18T03:18:51.810253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:18668be8636bf0e312dd760ec3fc68f52ad7d55a50154423c8847b21e7b8fb81","observation_id":"cd4efb21-6969-4288-8197-2b6727b2a138","resolution":{"observed_at":"2026-05-18T03:18:51.814142Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":"2005.14165","doi":"10.1145/1926385.1926423","metadata_source":"pith","pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Models are Few-Shot Learners","venue":"cs.CL","work_id":"214732c0-2edd-44a0-af9e-28184a2b8279","year":2020},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:ea27da0fa0f512759d7961768aafd84ebeaf9a0293bf4913f9c968217d1cf8c3","observation_id":"46cc1ed0-9c66-4c19-8723-c62ad851a954","resolution":{"observed_at":"2026-05-18T03:18:51.818322Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Coyo- 700m: Image-text pair dataset","venue":null,"work_id":"859f1895-a225-4055-8bcb-34f521f4715d","year":2022},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:cc415e0931864e4a1f66f25db407d822787c8815ba2e4e572279e146f1771b51","observation_id":"1cc48520-f9e2-4231-9bfb-ad9d3a3d0c03","resolution":{"observed_at":"2026-05-18T03:18:51.868050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to- end object detection with transformers","venue":null,"work_id":"f761db6a-da28-46c5-be2e-704200bdeeb7","year":2020},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:2266fb0f695292d44b51beb3ca76df7192ac10465715b0274e7f79db533cd95e","observation_id":"b788be39-6370-448f-8d45-518299d7e79e","resolution":{"observed_at":"2026-05-18T03:18:51.871325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"036800fe-5082-462a-ad0b-640fab847908","year":2021},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:4ab5f1e6bd7eea226bc408ad047a1f75f83fe1bd154d85583b624f9505725c4c","observation_id":"8f7a8dbf-f0ed-495c-9f10-12fa286256be","resolution":{"observed_at":"2026-05-18T03:18:51.874884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":"2306.15195","doi":"10.48550/arxiv.2306.15195","metadata_source":"pith","pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","venue":"cs.CV","work_id":"44525076-312a-4259-b79c-134cd7eeb297","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:3e632b50dfd938024735f1279b77ae195087c6c6d1ffb973c014cc02bf639673","observation_id":"aa5f582f-dcfa-46cf-ada1-b57716b280ed","resolution":{"observed_at":"2026-05-18T03:18:51.822093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":"2209.06794","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-07-04T19:30:07.491958Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","venue":"cs.CV","work_id":"29921cff-29c1-4aad-a27d-adac346027ec","year":2022},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:8ce312c353fbd02ff8e0f7fbe795c02d31a30bc48781c6917b5978988dd250e0","observation_id":"045c4426-7361-4bd1-bdc4-7d51ba13ce1b","resolution":{"observed_at":"2026-05-18T03:18:51.826291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shazeer, Vinodkumar Prabhakaran, Emily Reif, Nan Du, Benton C","venue":null,"work_id":"71b13e5b-dd6f-4309-bc8b-65cd035292c7","year":null},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:4c455dd4893e769fef628b7e81baa3dafff2c7836afc5e6b196e3c9d2c861625","observation_id":"2a5f5f0e-1200-4f1e-95e3-ccd6186fafa1","resolution":{"observed_at":"2026-05-18T03:18:51.884663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:66eb08e00777481d255a022ce8cc4afd388d7249af612407be2d45237f7de81e","observation_id":"aa1e4a5a-7b0b-4bc6-a4f7-d685307adbf0","resolution":{"observed_at":"2026-05-18T03:18:51.830880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Opencompass: A univer- sal evaluation platform for foundation models","venue":null,"work_id":"c5645487-4cb8-4296-8f56-a1cca6699929","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:ca93b61739330ffb45e4e628e6a2e51e8192f8c03aa732571e3b92749b4e727d","observation_id":"bf1ec431-8207-4d45-97b4-7adc78b71842","resolution":{"observed_at":"2026-05-18T03:18:51.890389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2305.06500","doi":"10.48550/arxiv.2305.06500","metadata_source":"pith","pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","venue":"cs.CV","work_id":"f3aac728-ded0-4e55-aa9e-4a1635d4313d","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:b844dec26d36da20bc21a32ad273e46aed4c151f21d8a6e1f6740da8f86abccb","observation_id":"c4ec7c7f-4f2c-4ac1-848d-4188eba549c3","resolution":{"observed_at":"2026-05-18T03:18:51.835167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:51.838916+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:51.838916+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xia, Mehdi S","venue":null,"work_id":"e055b2e1-b3ef-4b5c-a74f-65220f24ab3d","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:019cfa9342f5f92d9a69380c6fddfc80520174333bf8dc35eed2136824dd077a","observation_id":"adf7d802-bdb9-4848-88d6-6120231ba215","resolution":{"observed_at":"2026-05-18T03:18:51.896393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:8eec32d37becc8bfac8ca2a724f82947bd908397150adcd416af22fcc1c1c0b9","observation_id":"c95f173e-1bca-4237-879c-5b610b3c123f","resolution":{"observed_at":"2026-05-18T03:18:51.839531Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14108","last_updated":"2023-10-20T17:01:44Z","snapshot_observed_at":"2026-07-06T15:20:41.322682Z","submitted_at":"2023-04-27T11:37:18Z","title":"DataComp: In search of the next generation of multimodal datasets","version":5},"cited_work":{"arxiv_id":"2304.14108","doi":"10.48550/arxiv.2304.14108","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.14108","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Datacomp: In search of the next generation of multimodal datasets","venue":"arXiv (Cornell University)","work_id":"a309097d-9350-42a1-9232-7b765166f2da","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2304.14108","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:a64f94c50e3c3d871bcf237783e1698b1bb9bef4fb813170acf97e9e7b0b631b","observation_id":"50537838-c88e-44dd-add6-32810a4947d5","resolution":{"observed_at":"2026-05-18T03:18:51.844203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":"2304.15010","doi":"10.48550/arxiv.2304.15010","metadata_source":"pith","pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","venue":"cs.CV","work_id":"0fe2cfd8-d442-4ceb-b1a9-a465704f39b2","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:383873045fba0ca2e7ea1b3070f8e4ceb7e391ff34d610b2beafb65c58af7032","observation_id":"531e3cd3-b9be-42ca-b882-bac1a200d757","resolution":{"observed_at":"2026-05-18T03:18:51.639903Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":"2305.04790","doi":"10.48550/arxiv.2305.04790","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":"arXiv (Cornell University)","work_id":"e5fb1f2e-4ed2-454f-87a3-9e9c40f8fa31","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:f46a6255d139171f0db5f83b6518594b6c62e617d74358d448349467c0acce54","observation_id":"8f444185-6efc-40b1-b169-19812663166e","resolution":{"observed_at":"2026-05-18T03:18:51.645922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making the V in VQA matter: Ele- vating the role of image understanding in Visual Question Answering","venue":null,"work_id":"539a3403-9020-42dc-b0a3-2effd3760821","year":2017},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:410fee72fa6538640d94052d51893cdce7c6b88352d349b4267b26eef9e839c7","observation_id":"8bf39e90-255e-427a-ba7a-98a6cb1d969f","resolution":{"observed_at":"2026-05-18T03:18:51.910903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:24f3677d1e293b53405c5123ad80aee775a855dd074f15d83ee7d0af828427a4","observation_id":"376a0f8a-d07d-4bf2-9d9a-e6680b461bd9","resolution":{"observed_at":"2026-05-18T03:18:51.652730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14045","last_updated":"2023-03-01T11:04:51Z","snapshot_observed_at":"2026-08-02T16:45:23.309319Z","submitted_at":"2023-02-27T18:55:27Z","title":"Language Is Not All You Need: Aligning Perception with Language Models","version":2},"cited_work":{"arxiv_id":"2302.14045","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.14045","snapshot_observed_at":"2026-07-04T19:20:06.296460Z","title":"Language Is Not All You Need: Aligning Perception with Language Models","venue":"cs.CL","work_id":"2a1e0563-79f5-4521-8293-b8b1aebf7cee","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2302.14045","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:ebb22815387f250ebf9a701ef9aff4dc9bfaeac40181987a27db2f159aa719ae","observation_id":"54258956-4631-49d7-83ad-fb6969eace15","resolution":{"observed_at":"2026-05-18T03:18:51.658614Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"dc8f8700-f5c4-4d1c-a60a-39317020485d","year":2019},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:65107def08cabd4e9ad932d737069444456dab807422427cda822b6e3a930ae8","observation_id":"dc357717-0205-49cc-80cc-eb69a2f89d42","resolution":{"observed_at":"2026-05-18T03:18:51.918823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tgif-qa: Toward spatio-temporal reasoning in visual question answering","venue":null,"work_id":"a02df79b-3286-48b5-b485-6d3e18066052","year":2017},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:3fda957b886f016e88d225e87a4d8f107c1022b998347f0bba813d3b78b8b06f","observation_id":"7138ca41-f18e-4299-8197-30f5e168234d","resolution":{"observed_at":"2026-05-18T03:18:51.921195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual genome: Connecting language and vision using crowdsourced dense imageannotations","venue":null,"work_id":"cbbca424-03de-4533-b21a-00f33133904e","year":2017},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:84d149332b98801acd174929423f7df0c52430d51c7f55ac19632e932887e6fe","observation_id":"1ef21c4c-19b1-427a-80c1-9421962abb50","resolution":{"observed_at":"2026-05-18T03:18:51.923967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.02131","last_updated":"2023-03-14T23:51:53Z","snapshot_observed_at":"2026-07-06T13:38:24.920042Z","submitted_at":"2022-08-03T15:11:01Z","title":"Masked Vision and Language Modeling for Multi-modal Representation Learning","version":2},"cited_work":{"arxiv_id":"2208.02131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.02131","snapshot_observed_at":"2026-07-03T14:28:31.488306Z","title":"arXiv preprint arXiv:2208.02131 , year=","venue":null,"work_id":"b4673e89-f7a1-4bbd-ae3c-b66558968305","year":2022},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2208.02131","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:50fe1ae7ae6543c8e9d1e9162d7419f3a213dd9cbc34ab6db41e4e2cc3ea1b03","observation_id":"fc7a416a-d0d6-4b29-8305-a111b9e8910b","resolution":{"observed_at":"2026-05-18T03:18:51.664930Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rush, Douwe Kiela, Matthieu Cord, and Victor Sanh","venue":null,"work_id":"6943ec95-175f-48fd-976c-9d5586f9de90","year":null},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:ba9144eb842568b237a9ad7b235f337145547a935e21bb727283d241e45f3797","observation_id":"c7c84476-4eee-446d-8602-cc2768e882de","resolution":{"observed_at":"2026-05-18T03:18:51.928895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":"2307.16125","doi":"10.48550/arxiv.2307.16125","metadata_source":"pith","pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","venue":"cs.CL","work_id":"23881ff0-b851-474c-8712-90744cc07a3a","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:1623d7ee18a4f04fc348169d24273c855f69e1c3b4f7898655afb5956ca508be","observation_id":"38daaa6e-8ee2-4656-b93c-8e1be25435fb","resolution":{"observed_at":"2026-05-18T03:18:51.671246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2305.03726","doi":"10.48550/arxiv.2305.03726","metadata_source":"pith","pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","venue":"cs.CV","work_id":"33cb3a7a-6091-48db-a246-802bbb055f43","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:e1966d3e5ba8e59d1e3c7219331e83abaa667e12e97ff779fa9ec86bbfdfcf17","observation_id":"de6f8bcd-3f79-4abd-a14c-0f2f7af7bd6d","resolution":{"observed_at":"2026-05-18T03:18:51.676627Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":"2301.12597","doi":"10.48550/arxiv.2301.12597","metadata_source":"pith","pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":"cs.CV","work_id":"63d03f4d-15f4-4583-8286-913c19f02294","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:7b76b8c5619b432345db6809bcfa4280e9f43a48103d70d93b80da2afc9c8b98","observation_id":"edddc23b-c9ff-4a87-b594-1a214319f62f","resolution":{"observed_at":"2026-05-18T03:18:51.682240Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":"2305.06355","doi":"10.48550/arxiv.2305.06355","metadata_source":"pith","pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoChat: Chat-Centric Video Understanding","venue":"cs.CV","work_id":"07461eec-156c-4054-a28e-b84bc53bf6e1","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:b56e39a73031c526fe1b3fd1c99c17053602b3b622f3c2dddd67da1039187899","observation_id":"48b1f484-3639-4ead-a4b8-01f3bb01bddc","resolution":{"observed_at":"2026-05-18T03:18:51.688069Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2305.10355","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-07-10T11:37:03.198858Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","venue":"cs.CV","work_id":"66d8ac3e-c134-4995-b528-550afa17586f","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:606cb34ecdd54203b539904f9bc498a9642643056ce010fac3ae986752f86155","observation_id":"45ca166c-de2a-4486-a74b-f5882a991822","resolution":{"observed_at":"2026-05-18T03:18:51.693529Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Slimorca: An open dataset of gpt-4 augmented flan reasoning traces, with verification","venue":null,"work_id":"eb7c87f6-86c7-4092-8473-8678a9228eee","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:cf84c11dcf141b251a6932f0e5655fb76f0f6ee03b5646de510c52a31f95d032","observation_id":"8dbd5756-be1f-45f7-b9cc-d292468be12c","resolution":{"observed_at":"2026-05-18T03:18:51.945711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"165372de-9f6c-4371-903e-e36c55de3c6e","year":2014},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:7d013ac3525a8546c650ae0313c9dd58e09efbb075b54e4e8647b116503ebceb","observation_id":"b1de4368-e754-4b37-8ba0-98fde650054e","resolution":{"observed_at":"2026-05-18T03:18:51.853136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-07-06T15:46:40.281717Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":"2306.14565","doi":"10.48550/arxiv.2306.14565","metadata_source":"pith","pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","venue":"cs.CV","work_id":"ba8e8164-e47f-42d6-83ad-696cb57ee79a","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:105dcda9db0832e8c71696b0ff11a4a3c3faaeffcf7d3c2326db9a82fcec740f","observation_id":"b27c7cbc-14db-4736-95db-3e4986caa806","resolution":{"observed_at":"2026-05-18T03:18:51.700114Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2310.03744","doi":"10.48550/arxiv.2310.03744","metadata_source":"pith","pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improved Baselines with Visual Instruction Tuning","venue":"cs.CV","work_id":"5baeaa33-5986-44a3-85a4-fcabd6fc1e8d","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:7044023f8cff2bf7717de1ac9b410013513ee873736998c8d2dcd0fcbd38687a","observation_id":"e24a6a25-5838-4fab-aeb3-8cd7f8a95a70","resolution":{"observed_at":"2026-05-18T03:18:51.705895Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2304.08485","doi":"10.48550/arxiv.2304.08485","metadata_source":"pith","pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual Instruction Tuning","venue":"cs.CV","work_id":"68be622d-a6dc-4a13-82de-e3054a3dc509","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:3d090889228403d078d1a48c7c5e056156dc9f9deb20256b398efbd1cfa0ccde","observation_id":"4a7681a3-6995-44ea-ab55-5b2fb58eecfc","resolution":{"observed_at":"2026-05-18T03:18:51.712380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":"2307.06281","doi":"10.48550/arxiv.2307.06281","metadata_source":"pith","pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","venue":"cs.CV","work_id":"3b44943d-0f15-4228-9ac3-0e376f4f9ada","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:fe96fb81d6d0b378b9ca211a534fb05bae10573925f1efe3f1dc2925cb07e824","observation_id":"beda4e00-d371-4df3-addf-64e0a44886ba","resolution":{"observed_at":"2026-05-18T03:18:51.717146Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fixingweightdecayregu- larization in adam","venue":null,"work_id":"30ded15c-27f1-448d-a38f-deff51f50d4b","year":2018},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:131479f166648d5db1bbe46f7258df541228b5456abd8aa851eb20328a2c1d45","observation_id":"c3a4e4df-863c-4a38-acf7-45d60b07b916","resolution":{"observed_at":"2026-05-18T03:18:51.881298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":"2206.08916","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-07-03T17:18:44.037310Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.ArXiv, abs/2206.08916","venue":null,"work_id":"f27369a9-dc92-4410-8e8c-77255fa63f95","year":2022},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:e760274bbcf7f03ee6e5e4823aa678511b517db518be83d2876cb5a752f07d43","observation_id":"ae304f91-df2e-44eb-85c5-d36eacc2c498","resolution":{"observed_at":"2026-05-18T03:18:51.723093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":"2306.05424","doi":"10.48550/arxiv.2306.05424","metadata_source":"pith","pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","venue":"cs.CV","work_id":"51f627f4-8fae-4882-a3e9-abdf932ef27b","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:c81a4ab1f16a49c9f910be1ecc8ec0d3af667cab3ba5e46ccd416191ec2dedcf","observation_id":"cc3ae5ba-d5ed-47e0-a352-6eebeda33c17","resolution":{"observed_at":"2026-05-18T03:18:51.728083Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"b96d1008-2b10-4848-8c82-04d331256cbe","year":2019},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:ea82041e779629232ebcb74c5a14f943d952755165ecae5b9ecd7b23117b55d5","observation_id":"71cd6aa0-cb97-401e-89a3-5d24420e1974","resolution":{"observed_at":"2026-05-18T03:18:51.899248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.423556Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"046817c4-57c6-42b4-88da-0cc0836b4d5e","year":null},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:39b920771c5665158d8eb368728e1233d9350673af57d4c809d1548c21b2d40f","observation_id":"ebf9cce4-8f62-46fa-9ecc-4efda528a7f4","resolution":{"observed_at":"2026-05-18T03:18:51.903199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"5, 13, 17","venue":null,"work_id":"370f26ae-16fe-4149-b24d-e89a1e19763e","year":2019},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:f2d22608b70be46d814a945e60b50ea2f369a7423ea254e077cdd6728ca52d4e","observation_id":"77041ce3-75a5-477c-ba05-a8b120a3c703","resolution":{"observed_at":"2026-05-18T03:18:51.905783Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":"e3ab644e-fe07-426c-a5fe-dbbd104fdf6f","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:617370629962399f721b040302575edef4e47f740c2cde7f0b5a44d0e9d0a706","observation_id":"672c078b-d93c-44f2-a26a-0d824906bbdb","resolution":{"observed_at":"2026-05-18T03:18:51.908520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:fa0a127de052bf39db21639f92e14aea21f6bfa1a3d63d2593bc525aecf12b18","observation_id":"65d53aca-4246-4221-9440-c247fc70004f","resolution":{"observed_at":"2026-05-18T03:18:51.732444Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":"2306.14824","doi":"10.48550/arxiv.2306.14824","metadata_source":"pith","pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","venue":"cs.CL","work_id":"46e7f9e9-24c6-49af-b7d5-96159fa6f443","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:5b918621e31e9bf2394b630d877e771b162621ac6fa888fb4b16c2ab677b6399","observation_id":"363859b2-683e-4927-b3d5-1f50505575ea","resolution":{"observed_at":"2026-05-18T03:18:51.736822Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"891f58d5-015d-4a05-954b-fff3e500299a","year":2021},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:76b828e4d8cea32c62d3ffa571431da229c4b4865d3ea6cc3d6793ea93db165e","observation_id":"7df40d85-0076-4fc6-af2a-847eba804395","resolution":{"observed_at":"2026-05-18T03:18:51.926547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laion-5b: Anopenlarge-scaledatasetfortraining next generation image-text models.Advances in Neural In- formation Processing Systems, 35:25278–25294","venue":null,"work_id":"9e3fe557-d3fc-4c8a-a4a1-74fc981473bb","year":2022},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:d334070edf2769d1a78d08c7f3c2eff918db4399d36a0feaa31e54d8ced9d866","observation_id":"624e37af-4de2-4e27-bc0a-ea21285d6f6c","resolution":{"observed_at":"2026-05-18T03:18:51.931904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A-okvqa: Abench- mark for visual question answering using world knowledge","venue":null,"work_id":"f7423446-e659-4416-9b34-607f23b10186","year":null},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:2a9542e901677a5096a861d42c09f7b0aca0c77ab0249d2e279c7be148b77fe5","observation_id":"cf33827b-ab92-4308-aa38-b74c81478bfb","resolution":{"observed_at":"2026-05-18T03:18:51.934741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"5, 13, 17","venue":null,"work_id":"426ff089-1868-460a-8ae7-ea19e851818b","year":2022},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:80c89485f9b3cb8840d439e09f97d3a56620a96a22eea78dcbc41bf771726d71","observation_id":"175c5a8c-d7bf-42f8-a43a-cb8bf1cae27f","resolution":{"observed_at":"2026-05-18T03:18:51.937146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":"2002.05202","doi":"10.48550/arxiv.2002.05202","metadata_source":"pith","pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLU Variants Improve Transformer","venue":"cs.LG","work_id":"17d0763c-1016-41ab-a478-478e890765eb","year":2020},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:fb637d9b4c8233cb8c71cdf7acf62e67a685693e69610f160e72055901426376","observation_id":"8e4012cb-1099-48ea-83fb-5d86b182abd7","resolution":{"observed_at":"2026-05-18T03:18:51.740513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:31fc25cb38b5bdc6ef88908518989e77e18132ce69588537eea4afebc2014047","observation_id":"3b0cd216-b39c-457e-90d1-776d007642af","resolution":{"observed_at":"2026-05-18T03:18:51.744387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Textcaps: a dataset for image caption- ingwithreadingcomprehension","venue":null,"work_id":"bbb79cd3-194e-435b-bbc7-6277946230e0","year":2020},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:d048b2a0c41fe7965e02ea3b2a311cfef1b0217de4c254542a4741759d0b6328","observation_id":"263cd0dd-6105-4614-a500-a3b7ae773355","resolution":{"observed_at":"2026-05-18T03:18:51.857737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":"2309.14525","doi":"10.48550/arxiv.2309.14525","metadata_source":"pith","pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","venue":"cs.CV","work_id":"85bf563b-4790-4f8d-92e3-0ed210813c10","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:69ac6125b4295aad4bdb5793c92bbabd25517a994b599fa17c5adf9632b4b91a","observation_id":"3570651b-bb5e-4146-b65d-de388019a2cd","resolution":{"observed_at":"2026-05-18T03:18:51.748972Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:08.282214+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:08.282214+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":"2210.09261","doi":"10.48550/arxiv.2210.09261","metadata_source":"pith","pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","venue":"cs.CL","work_id":"513eb205-04ca-4722-9a43-a74e8cbe7e85","year":2022},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:1185bdaec2a56f0d5d56c805f93c90a06d56f1de95a4b0f324f6dafa3fe49f3d","observation_id":"8c92b47f-a279-4e35-9317-1968abfce620","resolution":{"observed_at":"2026-05-18T03:18:51.753187Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hashimoto","venue":null,"work_id":"e264ede8-78a6-46cb-bc70-aa8ee6c32973","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:a8a5a0cec789ecbed0ae0590c59447824112d6a3d5078f663daec6f1e24ddab1","observation_id":"601cfc42-d13f-4588-ad3d-701803007823","resolution":{"observed_at":"2026-05-18T03:18:51.878373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:72392be7d43eafecfd196afb155d48862498ce3c5869114fee5fd9bc610b922b","observation_id":"e2f105fe-74aa-4fa0-bd08-295baa97feb6","resolution":{"observed_at":"2026-05-18T03:18:51.634100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:f7953ba8690b0c49c281f71333cb9c043d36910362c3a3a3058b09cbac520b25","observation_id":"9f0a0de5-3a8a-403a-9a69-65e6a3f1558e","resolution":{"observed_at":"2026-05-18T03:18:51.757298Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":"2205.14100","doi":"10.48550/arxiv.2205.14100","metadata_source":"pith","pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","venue":"cs.CV","work_id":"45b0563f-7563-4f00-8da5-8be70ff803fb","year":2022},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:d87d8d3813394f7673b5ef13b66f1e85704edb1c1271bc01c86f8d8c90da7246","observation_id":"81fd797d-0d47-40e5-97a1-46b2a468fb81","resolution":{"observed_at":"2026-05-18T03:18:51.761087Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T07:53:51.898843+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T07:53:51.898843+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14181","last_updated":"2024-01-01T14:48:48Z","snapshot_observed_at":"2026-07-06T16:23:18.453624Z","submitted_at":"2023-09-25T14:43:43Z","title":"Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision","version":3},"cited_work":{"arxiv_id":"2309.14181","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.14181","snapshot_observed_at":"2026-06-30T13:34:40.544825Z","title":"Q-bench: A benchmark for general-purpose foundation models on low-level vision","venue":null,"work_id":"5cc0bbca-7cce-4f8c-bd9d-7b44a68d9062","year":2024},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2309.14181","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:6a279c994f9cc2d0f9be5fcabe836a54e75f200f5567c908efbe60c4bdb3a103","observation_id":"f42ccc44-ad91-4fa8-a89e-cc5147a91bb8","resolution":{"observed_at":"2026-05-18T03:18:51.765863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":"2304.12244","doi":"10.48550/arxiv.2304.12244","metadata_source":"pith","pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","venue":"cs.CL","work_id":"fc22911b-0900-4ad2-b106-337f13279965","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:dccc37f54d287bf0a8af861aab25b8f4c55ed22ed1f6dd9d4cc21b3e2c87c213","observation_id":"5fe46ad5-5219-465a-b98a-f6ff0b8df7b4","resolution":{"observed_at":"2026-05-18T03:18:51.769928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video question answer- ing via gradually refined attention over appearance and mo- tion","venue":null,"work_id":"5ed51984-3864-43a7-b588-7fa82d58f209","year":2017},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:8dbf46fd2626a9f214d416cd9986625d13a49dbbbdbb90abf4a8adae53a6da5a","observation_id":"36b968f5-7243-47ad-9beb-eb6f63ceb33e","resolution":{"observed_at":"2026-05-18T03:18:51.942415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In InternationalConferenceon Machine Learning","venue":null,"work_id":"2411b121-7c7d-438b-9e79-fc7683483203","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:cc0bf1b587a5cfdcb60f0496cbc5d3f77080bd90c3d3355946d07ab949db45c4","observation_id":"c5663e2a-2c52-41d4-97fa-d8c0c55f2202","resolution":{"observed_at":"2026-05-18T03:18:51.861000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-shot video question answering via frozen bidirectional language models","venue":null,"work_id":"dd153ae2-097a-43e6-a7c7-75073158dee4","year":2022},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:f8670e199a72e185d562fee7a6fea4caa2200480a02d71852f0166cac8e23db9","observation_id":"0a78790e-29d0-4296-8fb6-9ab2139f53c0","resolution":{"observed_at":"2026-05-18T03:18:51.865165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-01T15:24:02.956161Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":"2307.02499","doi":"10.48550/arxiv.2307.02499","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"mplug-docowl: Modularized multimodal large language model for document understanding","venue":"arXiv (Cornell University)","work_id":"990d95b3-f658-488d-b1a6-169e9e6aa7fb","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:599a44881a9b76e4d1d6a33e6ae8999790d7a19910ac244f2a79658c550897d5","observation_id":"d4b8cd34-6934-476d-8aab-f6f555e1387c","resolution":{"observed_at":"2026-05-18T03:18:51.774332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ureader: Universal ocr-free visually-situated language understandingwithmultimodallargelanguagemodel","venue":null,"work_id":"41e74d40-fe7e-4f52-89e5-ad55c85eb595","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:cbd6b7107092758190bf424a5f6ef11982f841193ecbe899685388fba839c086","observation_id":"c2a20675-9658-414a-915f-2d96836e3a41","resolution":{"observed_at":"2026-05-18T03:18:51.913586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hitea: Hierarchical temporal- aware video-language pre-training","venue":null,"work_id":"aeeee5a5-c1d8-45cb-aff1-ecf3ad4f6056","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:1de0925b864d4d65a80bdfb57620cab5cba175e236e39609a7ad2e47be2652ce","observation_id":"c1184676-be13-44ee-b55d-c037f1989874","resolution":{"observed_at":"2026-05-18T03:18:51.916523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":"2304.14178","doi":"10.48550/arxiv.2304.14178","metadata_source":"pith","pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","venue":"cs.CL","work_id":"74a7deb6-48be-4132-9d35-882cc5870ebd","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:d3c1be845701f03e0a44b40ccc6355cc0aac7ae1f93a1e9f355aa29930fd5ae8","observation_id":"15a88951-f765-42ba-bef5-0210290d1b26","resolution":{"observed_at":"2026-05-18T03:18:51.778085Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"33de30e4-2868-408f-ac2f-55fb653f61e5","year":2016},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:5b1b96ce56e22a76830608ba7a226036f74cda595536f1ce7f6bc9edbe7b3bb3","observation_id":"5705a2da-3131-4c87-9d8f-d21d7b23303d","resolution":{"observed_at":"2026-05-18T03:18:51.892981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-07-06T16:02:39.154387Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":"2308.02490","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-07-10T09:37:00.827227Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","venue":"cs.AI","work_id":"7f3bac41-a0a5-4a7a-bfd2-526b616db745","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:4564a64d4f174c702026a445c29d062cf831e76de38523c2263d10664e333d97","observation_id":"33796428-5124-40ac-bd43-d23f3ef608aa","resolution":{"observed_at":"2026-05-18T03:18:51.782964Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":"2306.02858","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-07-04T16:29:57.761121Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":"cs.CL","work_id":"555cf04a-49a7-44b8-9019-a83ce85ace95","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:c695b36f7d373f252ec2bc85a0350ed8975c3d0b527d5a12c6bb550cf30cfd1f","observation_id":"dc4a8f39-1acd-4589-9407-0614558899a3","resolution":{"observed_at":"2026-05-18T03:18:51.787911Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-04T22:58:51.675640Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:11bf74db373ac8bafc10449f63bd93b3623c280d4b8f78f4f963f763636fc71f","observation_id":"8a1aeacf-975c-4c5d-9467-ad30e2b5fedc","resolution":{"observed_at":"2026-05-18T03:18:51.793866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"P Xing, Hao Zhang, Joseph E","venue":null,"work_id":"fdc41192-5fbd-4ccc-b0ae-b299838a31a6","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:8d76f42d3e7702149bf6ea2796b6eb2f8596087f44ebabe37da4809be0d7e107","observation_id":"7a39f36c-0833-4151-9d18-3f9fad54b0ec","resolution":{"observed_at":"2026-05-18T03:18:51.939744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:a348eda61cbfe7d9df3f259cb299ad63e389ef694abe88eca29e9ebd3935fc42","observation_id":"9644ed94-4617-459d-9b84-777600b65e97","resolution":{"observed_at":"2026-05-18T03:18:51.798370Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":"2304.10592","doi":"10.18653/v1/2024.findings-emnlp.692","metadata_source":"pith","pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":"cs.CV","work_id":"a7e3a737-e007-42bc-be89-c4d34c5ee071","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:dc05888c6aaf67ec7c58caee8a456dd304b2a045f6ea6c4649bf184c36c335f0","observation_id":"caccece5-ae84-4be2-ba8b-24fb0dc06ac3","resolution":{"observed_at":"2026-05-18T03:18:51.802150Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":1,"unresolved":0,"verified_exact":40,"verified_fuzzy":32},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 26 inbound Pith citation observations for arXiv:2311.04257."}