{"as_of":"2026-08-11T06:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:622b5d865844d801f00a80c4c594eaf20e3e135cefb6058d92e094d5758a0386","coverage":[{"denominator":121,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T21:07:31.387726Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":345,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:32:39.016623Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T11:37:03.161139Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"reference_index":259,"source":"arxiv_source","source_observed_at":"2026-05-20T06:20:36.235304Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2408.04840"},"observation_digest":"sha256:1b82806003a9f3dde1d10c92df0da5ac1c86eeab78f213f29c62728a55541cd1","observation_id":"5d250947-2c35-464a-94cc-17cc158247b5","resolution":{"observed_at":"2026-05-20T06:20:36.553203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-05T11:54:14.447608Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:30dc6500b5e62613a7a388fe8eb6abd1141a57eec252f53494dd4528b4a127b8","observation_id":"cf4a475c-3692-42f6-8ae1-c03796870c41","resolution":{"observed_at":"2026-05-16T20:10:27.778951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-14T00:51:48.163349Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2409.02813"},"observation_digest":"sha256:07154e798009a9feb03a7e88355ef0dd3d94334446ac75ef4077c6265b4ca561","observation_id":"048256bc-2905-4a64-b816-96f26b93203a","resolution":{"observed_at":"2026-05-14T00:51:48.287816Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:7f68ec5863f6b3ed308592dfeb2e7716e32ba0cf64e34ccd3c372d8182db2b04","observation_id":"daf66416-f08f-4d51-8099-4bcdd218e5ec","resolution":{"observed_at":"2026-05-15T01:55:12.703706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:ab1a59f0914e743dd04f9a9ee243dfa1fb0e861be1fe8bc2b4b01a8f9d6e8b91","observation_id":"17c4ad5f-dc70-4c37-ad5e-3797dcbb1393","resolution":{"observed_at":"2026-05-23T20:13:24.906671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-10T05:52:50.722724Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T15:37:25.781240Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2410.10594"},"observation_digest":"sha256:72653ed382527e65da1ef40bdd12e8e9b916080667f4e4f937352eca8dbe93d9","observation_id":"64e38263-963c-4c30-bf23-819b050d7b98","resolution":{"observed_at":"2026-05-16T15:37:25.858911Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-16T11:35:25.894465Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2411.10440"},"observation_digest":"sha256:34ebccc9c142c38fabb86d6d494fc5c2f1aeadbe08d3e113f3d141d0ad6034a7","observation_id":"5b83001e-5293-432e-8119-73a7381bcc5b","resolution":{"observed_at":"2026-05-16T11:35:25.926654Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-05-16T09:16:17.150383Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2411.10442"},"observation_digest":"sha256:a91e7c11cccaa16228f62a4a80c6c62aaf61f83221b007ff4c90484ead28b682","observation_id":"7e04521a-20fa-410c-9ea5-c78ad8e9b73a","resolution":{"observed_at":"2026-05-16T09:16:17.533490Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:d78cc618c5aada55197d7609692c52138ee7cacc1e2a48426e36e571a00170e1","observation_id":"c392ca64-216d-42c5-92cc-b81534e786c0","resolution":{"observed_at":"2026-05-23T07:42:43.085376Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":275,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:b69ba6e6e5561cf67d0c664cd56d698ea79e556c302f291d8995d702d4e8af73","observation_id":"1edd3384-b802-4f65-b7ce-d7a4f401e01d","resolution":{"observed_at":"2026-05-10T21:07:32.698795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-11T10:09:21.542356Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2412.10302"},"observation_digest":"sha256:dfd2b5f687d8a4a310df0d0c8272c36889c2567d07ff74bfb23c7e7069c0ef76","observation_id":"416b2fef-0977-47fa-b7d8-10de4ec6081f","resolution":{"observed_at":"2026-05-11T10:09:26.093799Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2412.16855","last_updated":"2025-04-01T08:48:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-22T04:40:24Z","title":"GME: Improving Universal Multimodal Retrieval by Multimodal LLMs","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-15T06:35:22.508168Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2412.16855"},"observation_digest":"sha256:5beadca629d94f8d5c9593e875b301488df6d583b361a99ad7674fc98aebf16d","observation_id":"5fa15f62-dcc9-4bad-b5a9-9771821c0756","resolution":{"observed_at":"2026-05-15T06:35:22.621781Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-11T05:32:39.016623Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17451","last_updated":"2025-06-06T10:36:59Z","snapshot_observed_at":"2026-08-11T05:24:46.385118Z","submitted_at":"2024-12-23T10:18:41Z","title":"Diving into Self-Evolving Training for Multimodal Reasoning","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:39.016623Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2412.17451"},"observation_digest":"sha256:e180c0b03d9ab0122ec495d818586268eb647252a7f9fee99fa3df837c4f2b0c","observation_id":"2bdbebda-d4f6-475e-a1b9-1b4c876c8e13","resolution":{"observed_at":"2026-08-11T05:32:39.016623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-11T00:53:00.900121Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19238","last_updated":"2025-04-26T14:25:31Z","snapshot_observed_at":"2026-08-11T00:45:49.840384Z","submitted_at":"2024-12-26T14:44:47Z","title":"FineVQ: Fine-Grained User Generated Content Video Quality Assessment","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T00:53:00.900121Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2412.19238"},"observation_digest":"sha256:17041f902a726ff5bbe32fed980f4272b7f17d2ce07b91f280940d6435148bc9","observation_id":"c34f2ed9-59f0-4ab3-8227-9f7cff8899de","resolution":{"observed_at":"2026-08-11T00:53:00.900121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2412.20718","last_updated":"2026-04-08T17:39:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-30T05:18:55Z","title":"MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T07:14:27.786918Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2412.20718"},"observation_digest":"sha256:2643b52c48f65321be470240a3a0049b7934fce12716e03a01510da9dade9a7f","observation_id":"7fa555d8-69a7-4e25-bfd6-cf2aaeecd6c6","resolution":{"observed_at":"2026-05-23T07:15:28.520364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T23:16:55.085117Z","title":"Minicpm-v: A gpt-4v level mllm on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-11T01:13:07.664226Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:55.085117Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:3ff34304165968f5a3e2fc219ee2233fe06b31dc73d2d90f457c96d3c9f3a3ae","observation_id":"2d55d716-a0c4-454c-a509-2261670d070e","resolution":{"observed_at":"2026-08-10T23:16:55.085117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T23:12:19.062819Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-10T23:04:59.344646Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.062819Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:546d045fe7c90c26830a49afdcebabfbb0a3a00fc64ba51924fc3b0a01a942d2","observation_id":"68a87777-4a55-48e2-9ca2-812259c9f4dc","resolution":{"observed_at":"2026-08-10T23:12:19.062819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-07T17:13:10.057242Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:04552fc4c2b6a3aee9925badd375e12ff238ec520b11fb128203c9af9a9410b4","observation_id":"4f54d04a-5df7-454b-8280-6272c16950d3","resolution":{"observed_at":"2026-05-17T20:33:26.818046Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T22:52:00.992916Z","title":"Minicpm-v: A GPT-4V level MLLM on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00513","last_updated":"2025-03-18T16:01:24Z","snapshot_observed_at":"2026-08-10T22:46:57.431139Z","submitted_at":"2024-12-31T15:53:50Z","title":"CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:52:00.992916Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.00513"},"observation_digest":"sha256:8569ae1285566d874c6824a585ac2206cadda382d648036fd862e80acf10fa2a","observation_id":"66db1a8e-0e96-4913-b571-c44d84f7ba0f","resolution":{"observed_at":"2026-08-10T22:52:00.992916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T22:41:33.635688Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-11T03:06:20.615484Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.635688Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:b638be1ce3cc0dd4195cc0fb2c6bd441c71f0e9259a1f39dd7d495b7bcb8857c","observation_id":"0df0f12a-c6bb-45d4-98c9-88d37be09f77","resolution":{"observed_at":"2026-08-10T22:41:33.635688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T22:36:03.847783Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01282","last_updated":"2025-01-02T14:42:37Z","snapshot_observed_at":"2026-08-10T22:56:28.015864Z","submitted_at":"2025-01-02T14:42:37Z","title":"CultureVLM: Characterizing and Improving Cultural Understanding of Vision-Language Models for over 100 Countries","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:36:03.847783Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.01282"},"observation_digest":"sha256:df4c5899bfd384442f540b4e4904f0e5f48f6105f715cada062df2da73dbf462","observation_id":"e9e8297b-fb45-4ee4-8ef3-3a56a86f5e7e","resolution":{"observed_at":"2026-08-10T22:36:03.847783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T22:32:55.650893Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-08-10T22:25:36.091919Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:55.650893Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.01428"},"observation_digest":"sha256:c69a69904f3f5518e22a72711e9a84f65fb1f45b3785b6dcfa57cb905e7a8403","observation_id":"8e6cc233-c205-4650-a74a-1c5dccec854c","resolution":{"observed_at":"2026-08-10T22:32:55.650893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T23:09:25.131989Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-08-10T23:44:53.833723Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T23:09:25.131989Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.01986"},"observation_digest":"sha256:c3baf8929fa4a2c04436bedc8b2ddc1bbcdf03e9391dea208d9f166be9c77246","observation_id":"8e2a0a33-88e0-4f27-80fb-af682b32c4ba","resolution":{"observed_at":"2026-08-10T23:09:25.131989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2501.02955","last_updated":"2026-05-12T15:02:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-06T11:57:38Z","title":"MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-23T05:44:31.546843Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.02955"},"observation_digest":"sha256:042c152a07c7cbda7fc8820a2e2ac696b70a6aba116736c1d4309f8d6575aed9","observation_id":"70e625b0-98a3-4bc0-b447-b3a6e47742e2","resolution":{"observed_at":"2026-05-23T05:45:28.384333Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T21:31:16.337149Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04670","last_updated":"2025-07-09T08:04:21Z","snapshot_observed_at":"2026-08-11T01:32:03.608835Z","submitted_at":"2025-01-08T18:30:53Z","title":"Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T21:31:16.337149Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.04670"},"observation_digest":"sha256:720468f4509ad195c4f09caccae42e8f42ccfbf85e6eaef7f353574de7d82774","observation_id":"fb206a06-e5a0-4e86-87c7-d27abfecece4","resolution":{"observed_at":"2026-08-10T21:31:16.337149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T21:22:19.885529Z","title":"Minicpm -v: A g pt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05081","last_updated":"2025-01-09T09:02:41Z","snapshot_observed_at":"2026-08-10T21:17:05.957075Z","submitted_at":"2025-01-09T09:02:41Z","title":"DriVLM: Domain Adaptation of Vision-Language Models in Autonomous Driving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:22:19.885529Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.05081"},"observation_digest":"sha256:a79d35657e0c84eecc19c9fdd23013e9ed66483251acb2322afe849af4fd9dea","observation_id":"6f65249d-b997-44d2-a874-e22410aced12","resolution":{"observed_at":"2026-08-10T21:22:19.885529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-11T04:29:34.801288Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T04:21:43.212736Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.801288Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:d184c105bbb0b2f600962bd2c34222695eacf6e037d7cbacf3313d58d7b184cb","observation_id":"5e4a0f9a-7f97-42a2-893c-ebb612184070","resolution":{"observed_at":"2026-08-11T04:29:34.801288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T21:10:40.688619Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-08-11T03:06:16.794850Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:40.688619Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.05767"},"observation_digest":"sha256:696a45c4d4edd14bb550f601e8c4c77a6a327c2f88ece6a612a1e7fbbfabe970","observation_id":"229b63c0-920d-4bf5-8e54-ef2870373f59","resolution":{"observed_at":"2026-08-10T21:10:40.688619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T21:11:43.373939Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:43.373939Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:ae8682c451dccd98eb72159512198f527e4ade36ea8a6ba2735bdfea9bf19694","observation_id":"45a1ae2e-43c5-431f-93d3-48045b7b4696","resolution":{"observed_at":"2026-08-10T21:11:43.373939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T21:10:19.228951Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-10T21:04:00.512365Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.228951Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:0a9865c82bd662562488bd1d73bcd9ff3b355cc5ae09b4a737ee94f5fe8f4d23","observation_id":"de5346b8-f4ac-4498-8ad4-89cf841e88fb","resolution":{"observed_at":"2026-08-10T21:10:19.228951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T21:03:45.405848Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06598","last_updated":"2025-07-02T04:47:37Z","snapshot_observed_at":"2026-08-10T20:54:40.750061Z","submitted_at":"2025-01-11T17:52:22Z","title":"ChartCoder: Advancing Multimodal Large Language Model for Chart-to-Code Generation","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T21:03:45.405848Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.06598"},"observation_digest":"sha256:165d157030be105d8b461951cce74c6f515f8499faf0d5b14b710ca221618491","observation_id":"2bf7c2dc-2048-4587-9c06-dfb079dabed5","resolution":{"observed_at":"2026-08-10T21:03:45.405848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T20:57:12.889393Z","title":"Ruijie Zheng, Yongyuan Liang, Shuaiyi Huang, Jianfeng Gao, Hal Daumé III, Andrey Kolobov, Furong Huang, and Jianwei Yang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06713","last_updated":"2025-01-26T08:17:35Z","snapshot_observed_at":"2026-08-10T20:51:57.195951Z","submitted_at":"2025-01-12T04:44:06Z","title":"MiniRAG: Towards Extremely Simple Retrieval-Augmented Generation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:57:12.889393Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.06713"},"observation_digest":"sha256:fba1c09994c1785af7a81eb80a6dcd37e4593728bf533fa1084247c5260df4cf","observation_id":"95c19102-a797-4ee6-907a-46d3e3319f82","resolution":{"observed_at":"2026-08-10T20:57:12.889393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T20:46:17.656050Z","title":"Minicpm-v: A gpt-4v level mllm on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-10T20:47:05.927984Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.656050Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:1aa6ff77cf1d901f49d390d7b80e57aaa511c3c20f17155ff4292d57f0839163","observation_id":"abdd08d9-1c36-4410-8b3f-a3c06f7b886e","resolution":{"observed_at":"2026-08-10T20:46:17.656050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T19:27:42.350079Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10057","last_updated":"2025-01-17T09:22:35Z","snapshot_observed_at":"2026-08-10T19:21:21.292808Z","submitted_at":"2025-01-17T09:22:35Z","title":"MSTS: A Multimodal Safety Test Suite for Vision-Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T19:27:42.350079Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.10057"},"observation_digest":"sha256:e4eca6da48b9958951302684eb1902511ea4f0af6c03f7115dcb14a7d17e52e6","observation_id":"6299dc3c-d1e6-4c66-a861-d7ea2db71293","resolution":{"observed_at":"2026-08-10T19:27:42.350079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T18:24:42.306289Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11347","last_updated":"2025-03-15T02:35:48Z","snapshot_observed_at":"2026-08-10T23:54:31.304399Z","submitted_at":"2025-01-20T09:12:06Z","title":"EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T18:24:42.306289Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.11347"},"observation_digest":"sha256:5c02322e2a0930aac3214f7f629d1b6fb06688454063dd305cf3a7fc47b506de","observation_id":"372eac7f-9528-4376-86e2-70e689fc2212","resolution":{"observed_at":"2026-08-10T18:24:42.306289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T16:34:40.479177Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13042","last_updated":"2025-02-25T16:41:36Z","snapshot_observed_at":"2026-08-10T17:26:49.719937Z","submitted_at":"2025-01-22T17:44:01Z","title":"Does Table Source Matter? Benchmarking and Improving Multimodal Scientific Table Understanding and Reasoning","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T16:34:40.479177Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.13042"},"observation_digest":"sha256:f47c1a39b4e61d9a9506213cb76e79a549fca8a980a2d0bd5c493a5dad144ba1","observation_id":"6510ff94-4e0b-4955-ab29-7a8d8f84d221","resolution":{"observed_at":"2026-08-10T16:34:40.479177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T15:58:24.562366Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13468","last_updated":"2025-01-23T08:33:10Z","snapshot_observed_at":"2026-08-10T15:52:49.177380Z","submitted_at":"2025-01-23T08:33:10Z","title":"Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T15:58:24.562366Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.13468"},"observation_digest":"sha256:7f0f70e8094f3342d98501990cb34724c7b7f9fcc0e29eee6591b56079190571","observation_id":"b794a00e-4b7d-40ad-af16-85c7f9576a09","resolution":{"observed_at":"2026-08-10T15:58:24.562366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T15:35:30.284542Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-11T01:32:58.320917Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.284542Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:4b14701de9a1453b49554597d0e7db647b9b9ba6e6628638acd89def36459823","observation_id":"7f1bde46-37a7-46b4-92ce-81e5ab375542","resolution":{"observed_at":"2026-08-10T15:35:30.284542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T15:18:49.949655Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-10T17:27:56.139049Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.949655Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:d06ee02202ebafdfac834ca9da1e94af5a95cdcc252153f5c1680e15768b82c8","observation_id":"5bf02c69-1611-4eb0-888a-7a11ed03c12f","resolution":{"observed_at":"2026-08-10T15:18:49.949655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T18:04:34.846395Z","title":"MiniCPM-V: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-11T01:59:38.596539Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"reference_index":194,"source":"pdf_text","source_observed_at":"2026-08-10T18:04:34.846395Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.14818"},"observation_digest":"sha256:aba4643b5101953284bb968fda24d5459e13774f1900b8885f49d81514ea2be3","observation_id":"dcdd8519-0379-4628-8d66-9235d10f0d7c","resolution":{"observed_at":"2026-08-10T18:04:34.846395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T14:38:24.523145Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.523145Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:f9f5b17e918b95b12e63d39f68c8108588a583745ba9b026703348eb0ac192fb","observation_id":"a700a717-608f-4fbb-b18d-4bd2b1c7d44b","resolution":{"observed_at":"2026-08-10T14:38:24.523145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T14:38:25.886778Z","title":"Minicpm-v: A gpt-4v level mllm on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15147","last_updated":"2025-02-23T08:09:48Z","snapshot_observed_at":"2026-08-10T23:31:18.953994Z","submitted_at":"2025-01-25T09:11:15Z","title":"A Causality-aware Paradigm for Evaluating Creativity of Multimodal Large Language Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:25.886778Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.15147"},"observation_digest":"sha256:5a5a063289f74e3927d2640f32717202ad7c6ec0a4bbaeafa251e07bb57eda00","observation_id":"f2aa5815-5ce0-48b4-927c-89cb709f28f6","resolution":{"observed_at":"2026-08-10T14:38:25.886778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T14:36:53.089817Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15183","last_updated":"2025-08-21T07:54:29Z","snapshot_observed_at":"2026-08-10T14:29:53.302996Z","submitted_at":"2025-01-25T11:45:49Z","title":"Generating Negative Samples for Multi-Modal Recommendation","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T14:36:53.089817Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.15183"},"observation_digest":"sha256:2c05b9fea09ecfff7051da021b14e8f15b5c6b32f25f62bd3425110e743904d4","observation_id":"abd0c2c8-d85a-43af-b746-4a79d91a49a0","resolution":{"observed_at":"2026-08-10T14:36:53.089817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T14:14:54.793847Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15558","last_updated":"2025-01-26T15:20:39Z","snapshot_observed_at":"2026-08-10T14:08:06.447128Z","submitted_at":"2025-01-26T15:20:39Z","title":"Ocean-OCR: Towards General OCR Application via a Vision-Language Model","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T14:14:54.793847Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.15558"},"observation_digest":"sha256:7b2409c5e19129c1d9cce84d4b683a179f43472a845a9d9970f8cae0c413f77a","observation_id":"54c3e1e7-ad50-4283-b2a0-586d384c5a29","resolution":{"observed_at":"2026-08-10T14:14:54.793847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T14:03:31.547592Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15795","last_updated":"2025-01-27T05:41:10Z","snapshot_observed_at":"2026-08-10T13:54:36.304936Z","submitted_at":"2025-01-27T05:41:10Z","title":"Can Multimodal Large Language Models be Guided to Improve Industrial Anomaly Detection?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T14:03:31.547592Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.15795"},"observation_digest":"sha256:1f23e11a67cad0eb1ee5a3adfcf741bf946d12be577535a3ec6692e2eb094281","observation_id":"f972dcc8-9438-43fa-8503-ac71b087c2a5","resolution":{"observed_at":"2026-08-10T14:03:31.547592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T13:38:18.875541Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.875541Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:01303f643f688ca16dad76ecef3013ed1449626572105b8af88a7fe3a0ec7409","observation_id":"9bd10117-1474-4938-a48d-c544a1805316","resolution":{"observed_at":"2026-08-10T13:38:18.875541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T05:35:54.126695Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.126695Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:9ca8c534840bd6b9cb62c92d04ee0386df98f0d98087298a1776925707823b9c","observation_id":"7abc8490-a37f-48ea-8e9a-50f82133dae3","resolution":{"observed_at":"2026-08-10T05:35:54.126695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T00:43:29.271945Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T09:14:26.425079Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:29.271945Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:a9a051ce24d50850da5e30dca98fc2c41a2d4ae6808f7eeb386e1da18025e312","observation_id":"6edbb00f-43ea-488c-9d79-e57a745fb3d2","resolution":{"observed_at":"2026-08-10T00:43:29.271945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-09T23:03:34.685227Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18565","last_updated":"2025-04-01T03:18:58Z","snapshot_observed_at":"2026-08-10T11:27:03.122346Z","submitted_at":"2025-01-30T18:38:09Z","title":"BounTCHA: A CAPTCHA Utilizing Boundary Identification in Guided Generative AI-extended Videos","version":3},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-09T23:03:34.685227Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.18565"},"observation_digest":"sha256:9e13d15f364933a99bc5e1e01e0ad5bdd3d6977e78c09e6aceddff398e7dd8df","observation_id":"b2996d25-593c-413e-affc-24f4c888d332","resolution":{"observed_at":"2026-08-09T23:03:34.685227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-09T21:39:21.824073Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-10T12:01:17.734125Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.824073Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:f05e188f275b73b0f91b9455f4e0d11055b0b031c7f00373452881df92a3a93b","observation_id":"b1a9de48-f850-4970-9e30-ba437f924d71","resolution":{"observed_at":"2026-08-09T21:39:21.824073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-09T19:12:56.281848Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00425","last_updated":"2025-08-10T04:13:03Z","snapshot_observed_at":"2026-08-11T03:00:26.939226Z","submitted_at":"2025-02-01T13:08:02Z","title":"MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T19:12:56.281848Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2502.00425"},"observation_digest":"sha256:0cd9560876bed148d835abba43f9ca6e92e346bfac5453d75d4308b4f9d40767","observation_id":"74188231-6d98-474c-82a7-f5e46f1afd07","resolution":{"observed_at":"2026-08-09T19:12:56.281848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-09T15:04:36.909300Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01549","last_updated":"2025-02-03T17:30:19Z","snapshot_observed_at":"2026-08-09T16:01:36.816495Z","submitted_at":"2025-02-03T17:30:19Z","title":"VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:36.909300Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2502.01549"},"observation_digest":"sha256:ac313ce3ae0fc3e2a66476c1ac7156971e2caab7a5d5379defb8f618b78e5f59","observation_id":"85737c1c-4f44-4ac8-b28b-184f8961b33b","resolution":{"observed_at":"2026-08-09T15:04:36.909300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-08T22:47:39.349659Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-10T02:46:21.304913Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.349659Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:d124eae215c7278ae9a647ce9f702ad1858d505ae016ba041c98348c39827cd4","observation_id":"1e41759d-1964-4f45-a720-32c7192f653a","resolution":{"observed_at":"2026-08-08T22:47:39.349659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-08T21:03:24.029731Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04923","last_updated":"2025-02-07T13:41:51Z","snapshot_observed_at":"2026-08-10T06:10:52.406971Z","submitted_at":"2025-02-07T13:41:51Z","title":"Cached Multi-Lora Composition for Multi-Concept Image Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T21:03:24.029731Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2502.04923"},"observation_digest":"sha256:98bcd6fe87031df1dc1a626487f00843abfa0934bb804982ec50d0003d3491c0","observation_id":"05bd489a-113c-4044-a4e5-e7baa155387c","resolution":{"observed_at":"2026-08-08T21:03:24.029731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-08T20:19:49.339201Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05092","last_updated":"2025-03-18T11:43:52Z","snapshot_observed_at":"2026-08-08T23:15:52.258574Z","submitted_at":"2025-02-07T17:11:23Z","title":"Lost in Time: Clock and Calendar Understanding Challenges in Multimodal LLMs","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T20:19:49.339201Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2502.05092"},"observation_digest":"sha256:5e3c286729067354a4ce55686cbc1ca88cfe2b5a9ad1539cdf7b5ea5cae983ac","observation_id":"91866d10-44df-4a43-9712-ecb46efe9795","resolution":{"observed_at":"2026-08-08T20:19:49.339201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-08T17:54:22.379507Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05822","last_updated":"2025-02-09T09:07:11Z","snapshot_observed_at":"2026-08-08T17:47:10.111352Z","submitted_at":"2025-02-09T09:07:11Z","title":"HCMRM: A High-Consistency Multimodal Relevance Model for Search Ads","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.379507Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2502.05822"},"observation_digest":"sha256:03f9837583881dc3d55e0509eae673cd60f1019d789fd7d154a9e8517bc17ae2","observation_id":"5b816710-c759-41c7-b24f-d4ea4f6e995d","resolution":{"observed_at":"2026-08-08T17:54:22.379507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-09T11:20:02.930797Z","title":"Minicpm-v: A gpt- 4v level mllm on your phone","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.930797Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:46bde54e1ba0598bff178e7d5bb678d9a40e7f2eb84b43f318dd1dd7515e7164","observation_id":"831adb08-f292-4032-9ce2-52ce6f47f6c8","resolution":{"observed_at":"2026-08-09T11:20:02.930797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-08T12:54:56.359154Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-10T04:36:21.525026Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.359154Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:2a246d5b802f7797c316f3f45df9d93ee2791f4a6ae239e0079f8751ed3e5c02","observation_id":"028fa900-a965-4130-b355-e1a364996573","resolution":{"observed_at":"2026-08-08T12:54:56.359154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2503.02597","last_updated":"2026-05-15T01:15:57Z","snapshot_observed_at":"2026-08-03T04:26:47.170682Z","submitted_at":"2025-03-04T13:18:33Z","title":"Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-23T01:23:01.892612Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2503.02597"},"observation_digest":"sha256:d0db867b8dd4449c59edcccc2c74bbde95d71a04617fa8330a9b3b018bd914c4","observation_id":"47909c14-4047-42c1-93b0-5f87e0fb7fe5","resolution":{"observed_at":"2026-05-23T01:25:16.455129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T00:19:20.462455Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2503.10615"},"observation_digest":"sha256:b7303a90fd702ab10054237d99668ef945848f41601c79b8519c356cca787688","observation_id":"5da04e2d-232c-48f3-bd4b-2462588b8b30","resolution":{"observed_at":"2026-05-16T00:19:20.532886Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T15:04:22.690503Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2503.12937"},"observation_digest":"sha256:c986d0e6a98e0445521efe8f2fb5b2e00071ecf455c8da61700c85a202cb5f51","observation_id":"3bdea0e8-8c80-4a5f-bac3-c0bf25f9f2b8","resolution":{"observed_at":"2026-05-16T15:04:22.780495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2503.14075","last_updated":"2026-04-10T01:08:12Z","snapshot_observed_at":"2026-07-06T20:54:36.522651Z","submitted_at":"2025-03-18T09:52:45Z","title":"Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-22T23:58:57.819555Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2503.14075"},"observation_digest":"sha256:abfafdc797a4cc755d9253ef354eca626a09cb346021111eec03cc53f3327997","observation_id":"10ff2e47-624b-4e06-b7f6-4ebea279a1a0","resolution":{"observed_at":"2026-05-23T00:02:17.774286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2504.01805","last_updated":"2025-05-21T09:38:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-02T15:12:17Z","title":"SpaceR: Reinforcing MLLMs in Video Spatial Reasoning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T15:18:43.724432Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2504.01805"},"observation_digest":"sha256:5f92c80c9b4ad96f87bfcff0f73a805c9eaff98dfdaf19d7f212132c722ad625","observation_id":"8d035bdb-0cb2-43e2-b338-88dafefc0bd9","resolution":{"observed_at":"2026-05-15T15:18:43.853359Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T20:23:50.552549Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2504.05299"},"observation_digest":"sha256:75e895bcfd543d23f16656e6225821945c24e3283f896f11eb96646375a01904","observation_id":"b0837259-43ee-4398-a1a0-e5fd01681b30","resolution":{"observed_at":"2026-05-13T20:23:51.790378Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":136,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:5f1ed25b84d0accedb0a6bd3de2bbdb063d32c0b82ba1dbd84bc1c115b7afc7e","observation_id":"feae0bd9-8280-4765-92de-db8f78a2457a","resolution":{"observed_at":"2026-05-10T21:07:32.698795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-14T20:23:04.022599Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2504.13074"},"observation_digest":"sha256:65873f830ec73a349b1085c91c0f8ae9b7ad1f848b9766cc1eceb003db191ed8","observation_id":"497fbbe7-2723-44e2-9781-ae5f450fd426","resolution":{"observed_at":"2026-05-14T20:23:04.160478Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2504.13898","last_updated":"2026-05-12T14:42:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T06:27:02Z","title":"Social Human Robot Embodied Conversation (SHREC) Dataset: Benchmarking Foundational Models' Social Reasoning","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-22T21:14:13.351140Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2504.13898"},"observation_digest":"sha256:824a751b23ed9596cc45ec661c7e824b1dedf091575a6f8c42314fdb9d1f360e","observation_id":"7318a428-6471-4495-abf4-707192b9afda","resolution":{"observed_at":"2026-05-22T21:15:09.349994Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T15:42:30.405082Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14059","last_updated":"2025-05-20T08:03:59Z","snapshot_observed_at":"2026-08-10T10:24:50.264465Z","submitted_at":"2025-05-20T08:03:59Z","title":"Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:30.405082Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.14059"},"observation_digest":"sha256:06b379ded4fe0b7c8778f67af1a7a2b7e5083faa40cc7c4571efdf9e5975ae18","observation_id":"4c5624b1-b94f-4b5f-b519-a962239c7d6d","resolution":{"observed_at":"2026-08-07T15:42:30.405082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T15:42:56.038474Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14231","last_updated":"2025-05-20T11:40:43Z","snapshot_observed_at":"2026-08-07T15:35:48.142895Z","submitted_at":"2025-05-20T11:40:43Z","title":"UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:56.038474Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.14231"},"observation_digest":"sha256:2378d5740b91e9eec4cfe632f0f05895b2ab6e8792b5a691ee2937abc7cdd875","observation_id":"ae9036c9-f303-4130-80b5-698248930b2a","resolution":{"observed_at":"2026-08-07T15:42:56.038474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T15:38:37.759717Z","title":"arXiv preprint arXiv:2408.01800","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14438","last_updated":"2025-05-20T14:42:20Z","snapshot_observed_at":"2026-08-11T00:05:26.103197Z","submitted_at":"2025-05-20T14:42:20Z","title":"S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:37.759717Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.14438"},"observation_digest":"sha256:7e0eef5f5e029a8285f9838853483d370a51448c7fa10906a3e404b1670b0795","observation_id":"1847bc0e-6b6c-46ae-b58f-46a59b596cdb","resolution":{"observed_at":"2026-08-07T15:38:37.759717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T15:20:47.766618Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.766618Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:ab8784729a51c4e16a0d2293091c59dcbdf29368eca076ff9070607a91b8da96","observation_id":"dcf3998a-0299-44c7-99b1-60537273aa35","resolution":{"observed_at":"2026-08-07T15:20:47.766618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T15:15:42.281622Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.281622Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:8a4f0660a77883e05d1e675ef13d78cd70612c31c7fe5f7954126b5ea84088e7","observation_id":"901e1fc9-dabd-4011-8231-b168b2820735","resolution":{"observed_at":"2026-08-07T15:15:42.281622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T15:14:54.840336Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15929","last_updated":"2025-05-29T17:59:14Z","snapshot_observed_at":"2026-08-09T05:39:52.681912Z","submitted_at":"2025-05-21T18:33:50Z","title":"PhyX: Does Your Model Have the \"Wits\" for Physical Reasoning?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:54.840336Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.15929"},"observation_digest":"sha256:c3863a9fd103db3fcfb80d5cb718acaf3ee32b6e55eabea44dd05876b21bc456","observation_id":"6fa76702-21c1-4f01-8b2a-ed31e90f6b6f","resolution":{"observed_at":"2026-08-07T15:14:54.840336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:4f21b61ae331432f3b946c9283ac3429cce78a9c7a5688b1c16d4f80488f294a","observation_id":"1866e258-2d55-448d-b56c-dbcb34d455ad","resolution":{"observed_at":"2026-05-22T14:21:39.814756Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T15:02:26.814318Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-09T20:20:59.205626Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:26.814318Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:2e184837e63caa81bfc2b1bbf9575f8e79eba8f3f1d806f01e6976994a280148","observation_id":"565bbe37-6430-40e2-af36-f08aad36afa9","resolution":{"observed_at":"2026-08-07T15:02:26.814318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T15:01:33.558215Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16673","last_updated":"2025-05-22T13:39:32Z","snapshot_observed_at":"2026-08-07T14:55:04.641472Z","submitted_at":"2025-05-22T13:39:32Z","title":"R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:01:33.558215Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.16673"},"observation_digest":"sha256:011bbf8c3febbbbcf158cd11d0b3fc181c847d327c976b9b153c29bd9f5ab882","observation_id":"6f1abc63-c866-44a5-9634-c478b55cc4a1","resolution":{"observed_at":"2026-08-07T15:01:33.558215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:58:43.703291Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16770","last_updated":"2025-05-23T15:40:22Z","snapshot_observed_at":"2026-08-09T02:01:21.817942Z","submitted_at":"2025-05-22T15:11:57Z","title":"RBench-V: A Primary Assessment for Visual Reasoning Models with Multi-modal Outputs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:43.703291Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.16770"},"observation_digest":"sha256:5344f2e3db1e3734b47807515db55aa2c79db309d2c7b19d9ddd739e877d68b4","observation_id":"40a23375-22c8-4ce7-9b7a-86643a55d6ea","resolution":{"observed_at":"2026-08-07T14:58:43.703291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:57:43.483072Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16832","last_updated":"2025-05-27T23:23:45Z","snapshot_observed_at":"2026-08-10T20:31:54.568347Z","submitted_at":"2025-05-22T16:02:18Z","title":"From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:43.483072Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.16832"},"observation_digest":"sha256:f497395e7020033d1bb4f13c9d3653e7ccf557c8e379f0caa5bd8c05b86c51ab","observation_id":"f60da05b-fea0-46ac-900d-b30b5ee232fa","resolution":{"observed_at":"2026-08-07T14:57:43.483072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:46:05.858502Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17654","last_updated":"2026-05-27T08:26:10Z","snapshot_observed_at":"2026-08-07T14:40:44.563063Z","submitted_at":"2025-05-23T09:18:01Z","title":"EVADE-Bench: Multimodal Benchmark for Evaluating and Enhancing Evasive Content Detection","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:05.858502Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.17654"},"observation_digest":"sha256:336d324c1a71865f44c55890387370a0bf1d46c07e36dfd6f5178973b162c699","observation_id":"602428fb-e95d-4e4b-966f-52d63434c168","resolution":{"observed_at":"2026-08-07T14:46:05.858502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:34:52.093446Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:52.093446Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:225029b4937fffd6efc95705d317a4f4146c13b1c58a55d7843df27709029733","observation_id":"cd735611-0f77-43ff-9c69-1e1ee27c4c29","resolution":{"observed_at":"2026-08-07T14:34:52.093446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:18:40.650777Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19498","last_updated":"2025-08-19T02:37:11Z","snapshot_observed_at":"2026-08-08T18:27:44.638043Z","submitted_at":"2025-05-26T04:26:30Z","title":"Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:40.650777Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.19498"},"observation_digest":"sha256:daf3ad9918393be705bc43b892cfc56d0d44c67818b1757feccf019f18f535a3","observation_id":"ad36b43e-9f5e-4e51-8c2c-75c1979abe93","resolution":{"observed_at":"2026-08-07T14:18:40.650777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:14:46.015018Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-09T09:30:25.697403Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:46.015018Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:793aea2832e5e7550c0312421d999aaefd74ae15e7b9628c171197cd77ac38a1","observation_id":"0b5c142e-69e9-4709-91ce-7bed037176bb","resolution":{"observed_at":"2026-08-07T14:14:46.015018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:14:35.622257Z","title":"Minicpm-v: A GPT-4V level MLLM on your phone.CoRR, abs/2408.01800,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19707","last_updated":"2025-05-26T08:56:59Z","snapshot_observed_at":"2026-08-10T11:58:54.445231Z","submitted_at":"2025-05-26T08:56:59Z","title":"MLLM-Guided VLM Fine-Tuning with Joint Inference for Zero-Shot Composed Image Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:35.622257Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.19707"},"observation_digest":"sha256:e187338809540f019f8b1689262bfa8d105e82e3e3e3560423948d8f14dbeb0e","observation_id":"8a0b16a1-b190-4077-8ad9-53da8bd22410","resolution":{"observed_at":"2026-08-07T14:14:35.622257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:14:35.711208Z","title":"URL https://doi.org/10.48550/arXiv.2408","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19707","last_updated":"2025-05-26T08:56:59Z","snapshot_observed_at":"2026-08-10T11:58:54.445231Z","submitted_at":"2025-05-26T08:56:59Z","title":"MLLM-Guided VLM Fine-Tuning with Joint Inference for Zero-Shot Composed Image Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:35.711208Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.19707"},"observation_digest":"sha256:c9eca71fdf8372e2271b3a54acbff81f2b1bb40312c31daa17a66045675d4a25","observation_id":"5dff226c-658e-48f7-9170-acd6bdca4573","resolution":{"observed_at":"2026-08-07T14:14:35.711208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:07:37.755205Z","title":"Minicpm-v: A GPT-4V level MLLM on your phone.CoRR, abs/2408.01800,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:37.755205Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:17ab2a36391d8780e42c694b4fde571a0916cfd728ad82efa50a45d9fa50014e","observation_id":"11038ea0-4bce-4a62-bb5f-b711dbd1a21b","resolution":{"observed_at":"2026-08-07T14:07:37.755205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:07:37.813610Z","title":"URL https://doi.org/10.48550/arXiv.2408","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-08-08T23:43:58.252036Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:37.813610Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.19952"},"observation_digest":"sha256:a7341b0c3d49e750a50fac24ffe673ed101ce232ccc9acb873931cfb837d3e66","observation_id":"84835a9a-54c1-4b11-9ecc-8ea290504b13","resolution":{"observed_at":"2026-08-07T14:07:37.813610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:03:04.827954Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:04.827954Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:7dddcc115178d319e8b026bcfa68e2bd0702c38884caebd71b6bb6fcfcfcbd8a","observation_id":"07fee8e3-fcbb-424e-90ab-64d20723cb18","resolution":{"observed_at":"2026-08-07T14:03:04.827954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:02:51.005221Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.005221Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:c9046f09c9a825923979a25ae04e32da72773996130d0213b63a0fa28880c865","observation_id":"d14e2908-41ad-4ccf-8550-d93ac69167d0","resolution":{"observed_at":"2026-08-07T14:02:51.005221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T13:51:32.078030Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-07T13:44:55.542601Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:32.078030Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:02be39a96288c6d788939a5d276edb3b1ae9ff81f2c6f94fb9da66ee0b47a7b3","observation_id":"019551d9-c68a-4bf7-acad-7e23fd2cbdf4","resolution":{"observed_at":"2026-08-07T13:51:32.078030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T13:40:25.336819Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-10T17:27:34.890094Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:25.336819Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:508e0b6b877210b3a633bae67af21bda981e6505cd1a3dc715bd0f6956074a6c","observation_id":"c5336192-b0dd-44e1-8dea-3ac387e47985","resolution":{"observed_at":"2026-08-07T13:40:25.336819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T13:21:03.043936Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22039","last_updated":"2026-07-29T09:31:57Z","snapshot_observed_at":"2026-08-07T21:55:46.500544Z","submitted_at":"2025-05-28T07:02:15Z","title":"OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:03.043936Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.22039"},"observation_digest":"sha256:b97a67bf03529464dc7c57a2910eb74ab798982e3d4c9f52605b43b68282d5b6","observation_id":"15b75bad-1466-45a4-8766-15d94b277c09","resolution":{"observed_at":"2026-08-07T13:21:03.043936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T12:50:46.178092Z","title":"Minicpm-v: A gpt-4v level mllm on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23386","last_updated":"2025-05-29T12:11:28Z","snapshot_observed_at":"2026-08-10T11:21:17.255937Z","submitted_at":"2025-05-29T12:11:28Z","title":"VModA: An Effective Framework for Adaptive NSFW Image Moderation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:46.178092Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.23386"},"observation_digest":"sha256:e3a1fb2c64b7e8ace3aaa9f93265c6c851752585a0002d2bac9292352e59c434","observation_id":"bb2908f2-584b-4cca-a846-e6ff12b811b4","resolution":{"observed_at":"2026-08-07T12:50:46.178092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T12:47:01.136361Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-11T05:07:19.954822Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:01.136361Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:eaf68ce843a3fbf69d4c4c559c8b132812ca75d2faa8a166f12e1bf9faa0b72e","observation_id":"1eeb526c-3259-4c60-8d94-077fd5debf1a","resolution":{"observed_at":"2026-08-07T12:47:01.136361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:15:16.297715Z","title":"MiniCPM-V: A GPT-4V level MLLM on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23793","last_updated":"2025-05-26T08:39:14Z","snapshot_observed_at":"2026-08-08T01:18:19.713600Z","submitted_at":"2025-05-26T08:39:14Z","title":"USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:16.297715Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.23793"},"observation_digest":"sha256:b3a50762f1fdf843fc56a504465eb0ff575e0941651a1b3cccda192bdc1da171","observation_id":"dcb64f2c-9b35-48e2-8990-2a95b70739df","resolution":{"observed_at":"2026-08-07T14:15:16.297715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T12:37:23.584263Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24158","last_updated":"2025-05-30T03:04:28Z","snapshot_observed_at":"2026-08-10T08:26:14.415807Z","submitted_at":"2025-05-30T03:04:28Z","title":"Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:23.584263Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.24158"},"observation_digest":"sha256:1b0ddf5a5326b9692e26e3096cdf18663cdf432941b2aef8fede822fcb9d21e5","observation_id":"e9d53f51-3628-4ccd-8161-bafbb69f4d9a","resolution":{"observed_at":"2026-08-07T12:37:23.584263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T12:37:49.453135Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-09T00:48:58.339159Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:49.453135Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:5f42e8baff06761a2712959ab4ab00dc2871a8e6c850cd8515aa36eaf3981401","observation_id":"575783b0-dd21-4941-b5eb-464ca8c32aea","resolution":{"observed_at":"2026-08-07T12:37:49.453135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T12:32:54.728045Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-09T06:10:22.489105Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.728045Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:f49ba76317fde1efa39be231272c5a890bca84a163fb1584d496969cf805a43c","observation_id":"a1c6c84f-88c8-4d7f-876c-e230f0f6b518","resolution":{"observed_at":"2026-08-07T12:32:54.728045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T12:25:08.460726Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24541","last_updated":"2025-05-30T12:48:07Z","snapshot_observed_at":"2026-08-09T16:02:42.942836Z","submitted_at":"2025-05-30T12:48:07Z","title":"Mixpert: Mitigating Multimodal Learning Conflicts with Efficient Mixture-of-Vision-Experts","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:25:08.460726Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.24541"},"observation_digest":"sha256:99efa4f12559187ec8ae41bb11d925821eab5bad7352566154c9f60badf1ec83","observation_id":"8e7525b8-2c27-4704-bc89-1698c2ce5cd5","resolution":{"observed_at":"2026-08-07T12:25:08.460726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T12:16:15.718768Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.718768Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:cde915ee248469a1677268a3a8b1d75b4c0e8c5f09db2722874bdafebd4d1334","observation_id":"8944cc7b-10b1-4c98-b1bf-5159dde0e1f4","resolution":{"observed_at":"2026-08-07T12:16:15.718768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T12:09:10.058321Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00479","last_updated":"2025-05-31T09:10:43Z","snapshot_observed_at":"2026-08-09T06:24:07.358275Z","submitted_at":"2025-05-31T09:10:43Z","title":"EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:10.058321Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.00479"},"observation_digest":"sha256:ad995db3cea3751a367c0efa7ceb71094bae77172831b9db0a15176bf1d28c20","observation_id":"cd372c72-0a39-4af6-b4f3-f4bd6e731079","resolution":{"observed_at":"2026-08-07T12:09:10.058321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2408.01800/citation-record","integrity":"/paper/2408.01800/integrity","json":"/paper/2408.01800/citation-record.json","paper":"/paper/2408.01800"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":"2404.14219","doi":"10.48550/arxiv.2404.14219","metadata_source":"pith","pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","venue":"cs.CL","work_id":"feef9556-a016-493c-abd2-0c97a23a7ebf","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:a70d341ad38284f81bb313b1e1f0ea2528c956b659f9529b5c4a6e938919cf7b","observation_id":"6d5ebdc8-d0d4-4b72-839c-69066ad0d0b8","resolution":{"observed_at":"2026-05-10T21:07:32.191837Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:35b25aed4d5c378be827fa3657e92e856206c657a2113394b11f45a04f24baa3","observation_id":"7a151eb2-344f-4716-8226-a5df579b82d5","resolution":{"observed_at":"2026-05-10T21:07:31.809622Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RealCQA: Scientific chart question answering as a test-bed for first-order logic","venue":null,"work_id":"0666c064-d218-4cfc-9700-d17a2b16b9c9","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:1465d09c0f42bfe2412d0d1c7a8ec5bb03227a28640f123865c62a16c62e21c8","observation_id":"87f63b89-633d-43e7-ae02-462c4fbd2773","resolution":{"observed_at":"2026-05-10T21:07:32.307499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: A visual language model for few-shot learning","venue":null,"work_id":"43a8d436-3bd7-4eb7-8295-fbfb92e77e99","year":2022},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:62f0546abddc13cdb578422a63a023fd8e0f57049b3e17be8522973154779527","observation_id":"f03ce59d-1456-4127-b762-010895c1e5eb","resolution":{"observed_at":"2026-05-10T21:07:32.311593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing the next generation of Claude","venue":null,"work_id":"16ae6518-dee4-452a-9323-66ed3c4fdf3b","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:a5af00cdbe92fbd4e12c926bcd05642675d0fc1b39c3b65058cc2277c508967e","observation_id":"9098d65f-cacd-483e-8aab-6b53ce4c3e26","resolution":{"observed_at":"2026-05-10T21:07:32.317704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VQA: Visual question answering","venue":null,"work_id":"6cb9dbf9-2cbe-4deb-814c-b3c578a465ac","year":2015},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:b6c992cf3a88acdcce2e29935628e1f42319a20ab13f8717ef47c6d323f50098","observation_id":"88ce68f2-cc97-4cd5-a41b-e4faceca90a5","resolution":{"observed_at":"2026-05-10T21:07:32.325104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:4148d1f3269d3b4a74a93f5e79a4bf13d474d9b0bcad2116dffeb279c98c2161","observation_id":"8726c00d-f8be-4aad-ae73-bb128016f035","resolution":{"observed_at":"2026-05-10T21:07:31.778105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemma: Introducing new state-of-the-art open models","venue":null,"work_id":"8c1f5bb8-e395-4fe5-8ec2-ec60fdb2c92c","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:407a7922ba1a2393a32f231d16a49a07fe91c1de1e2ff59dcb371b8892f1ff38","observation_id":"745b3819-ff61-48f5-aa0c-b4be5368bded","resolution":{"observed_at":"2026-05-10T21:07:32.331255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing our multimodal models","venue":null,"work_id":"a05dacbf-1f75-4be2-ac5d-a18ce40403ed","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:92824dcd4dbf2c60233f360e6255b2fecd572a5533a238800643a18bdf5de4c7","observation_id":"7e200340-6491-4511-9270-b894d99d8207","resolution":{"observed_at":"2026-05-10T21:07:32.335334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BELLE: Be everyone’s large language model engine","venue":null,"work_id":"080197a0-e90e-4bfc-b646-c0ed53cbecff","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:fbcd6ec2991f9a23e0a0acc357a885302b5bf1558c3496f7a8193df729473848","observation_id":"efa43f8c-e91c-481e-82d1-74bedac78c2b","resolution":{"observed_at":"2026-05-10T21:07:32.342276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:eab5ef0bf8306aef8dbb2d0d67057d67162fe8752d653a4131ca5933c339e7f2","observation_id":"ec3cc497-4dc9-4bf2-be44-88cb9918c22a","resolution":{"observed_at":"2026-05-11T13:10:21.987351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scene text visual question answering","venue":null,"work_id":"497f3ae5-3885-41d5-9fcb-5bed51b792a6","year":2019},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:0aa1bf42692b19b58a367e597757b6f58caf4c4e78e7c5b21ec45edf18789ca3","observation_id":"cc4d3295-38e4-48f4-a8d1-59e85f2cce6c","resolution":{"observed_at":"2026-05-10T21:07:32.346596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OCR-IDL: OCR annotations for industry document library dataset","venue":null,"work_id":"64b633eb-9932-4074-8abd-b1cf6853d46b","year":2022},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:80340af71565709e43ba33a58b9a81e7d9e1ab987147704a9ac744efe999ef08","observation_id":"ca1c7fda-b4b2-40aa-beb5-ca5a93b30bfd","resolution":{"observed_at":"2026-05-10T21:07:32.354836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":"2303.12712","doi":"10.48550/arxiv.2303.12712","metadata_source":"pith","pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","venue":"cs.CL","work_id":"a23cfe92-7f7c-424b-98d4-b386a83002fb","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:4fa953d9d6a6c8c6f836ff6f8ea73b96beaf6fcf014334af04fc4792b84c9b19","observation_id":"b855ef06-e106-4bf2-ab21-b5edce1ecbcf","resolution":{"observed_at":"2026-05-10T21:07:31.676654Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"COYO-700M: Image-text pair dataset","venue":null,"work_id":"c4b2c8c6-b6d3-469a-b42d-a54ed5f0dae9","year":2022},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:e3a89d2240de586a8b55407b6907e8ba4b561c935c0447fada7508cd0a8cc1f1","observation_id":"3439004c-b48c-4ddc-b07f-954109e50740","resolution":{"observed_at":"2026-05-10T21:07:32.359435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TextOCR-GPT4V","venue":null,"work_id":"dc7f485c-2da1-43b2-a95a-f5db6e654823","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:cdc49ac15bfd2dcb0524fe00a2af14f101e2f9c76f8b64f631a529c438f9441b","observation_id":"d3171b1e-821a-497a-abdc-86314ce89e5a","resolution":{"observed_at":"2026-05-10T21:07:32.366200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conceptual 12M: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"23ec4a03-6e82-4fb2-977a-8b77c5cdaeb1","year":2021},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:d6c47fbf6f8045a5036324a568bbd7a100e5e6954754ff9143d0976c8b62f709","observation_id":"82d59889-eab0-4f66-8d03-5f22c6da5b96","resolution":{"observed_at":"2026-05-10T21:07:32.381545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:78135c786a7579685230ad6fb0b190fb845fb04f7326164f3cb800e2e1d82eb1","observation_id":"56e4d9ec-0f37-4b91-a8f7-79e175ca21f7","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14517","last_updated":"2022-01-11T03:50:31Z","snapshot_observed_at":"2026-08-10T11:40:32.211107Z","submitted_at":"2021-05-30T12:34:17Z","title":"GeoQA: A Geometric Question Answering Benchmark Towards Multimodal Numerical Reasoning","version":3},"cited_work":{"arxiv_id":"2105.14517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.14517","snapshot_observed_at":"2026-07-02T22:47:26.028530Z","title":"Geoqa: A geometric question answering benchmark towards multimodal numeri- cal reasoning","venue":null,"work_id":"dffe6af3-2c37-4256-b87a-6eab51b0f488","year":2021},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2105.14517","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:c2f4e5a45ac5459530ac041de6a224e2d12c3a73e34b886897751af3f7f896ac","observation_id":"93606d2e-aff9-4192-83a7-6235d9996db4","resolution":{"observed_at":"2026-05-10T21:07:31.981369Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":"2306.15195","doi":"10.48550/arxiv.2306.15195","metadata_source":"pith","pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","venue":"cs.CV","work_id":"44525076-312a-4259-b79c-134cd7eeb297","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:c7d9b3d124710462d9d7d8807faa9572243d57f1a11323c58e58b8fd36648d9d","observation_id":"fd8bc126-df1e-4dd1-bfe5-676d14f3fd45","resolution":{"observed_at":"2026-05-12T15:52:36.167809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":"2311.12793","doi":"10.48550/arxiv.2311.12793","metadata_source":"pith","pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":"cs.CV","work_id":"90e2b26a-3d27-4567-86b5-929b582a8034","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:5328101ba5decc7f7d74533b97d7f14f0a97057ddec60427e774d7d58996b8ee","observation_id":"6b89ee85-9cee-4256-ba48-f8092aedb43a","resolution":{"observed_at":"2026-05-13T17:08:13.182567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02164","last_updated":"2020-06-14T19:14:22Z","snapshot_observed_at":"2026-08-10T16:21:51.911168Z","submitted_at":"2019-09-05T00:25:17Z","title":"TabFact: A Large-scale Dataset for Table-based Fact Verification","version":5},"cited_work":{"arxiv_id":"1909.02164","doi":"10.48550/arxiv.1909.02164","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.02164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.02164 , year =","venue":"arXiv (Cornell University)","work_id":"8f8e6b3d-18b5-4a41-85d3-bcccd1c4d867","year":1909},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/1909.02164","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:2d6b03071d9a63b0b779038c9384f2b5d03b9887ac5f2816383c70242d0890c8","observation_id":"0b3ae36d-02f4-403c-8933-ec109337e893","resolution":{"observed_at":"2026-05-10T21:07:32.044962Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":"2404.16821","doi":"10.48550/arxiv.2404.16821","metadata_source":"pith","pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","venue":"cs.CV","work_id":"3714835e-c5a6-4d7e-950c-be44670ed9e6","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:b6d3ef559673cb2a61d06f85164f59dd22878dc23eedecc6cb39ac648828a1fc","observation_id":"c652621a-5ca1-4e1f-85fe-d51f742f87e3","resolution":{"observed_at":"2026-05-12T20:58:59.653229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are deep neural networks smarter than second graders? In CVPR, pages 10834–10844","venue":null,"work_id":"e9cd5385-6ef8-4c92-ab3f-5a7b91605623","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:df23900f4351ab9a501dcb896f7d78a31893b2a9e3531d848edece1abec3ea38","observation_id":"0f075659-094d-4266-bfeb-e2cddfe80577","resolution":{"observed_at":"2026-05-10T21:07:32.388095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:bdbe98e3eb2649cf9f3d884106e5a6397661aceede35a1b3e78bb9ee054cc667","observation_id":"609ae3d3-49e1-4bf3-95bc-b2c8c79df22a","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OpenCompass: A universal evaluation platform for foundation models","venue":null,"work_id":"3819b732-8539-4757-88eb-579adada99d6","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:6baf7f040eb42c54653e3a714aba9cedab93e6d4843dd5f7ae083ce01b8d5ed5","observation_id":"3211a1a1-c0b5-4310-a295-b75c02bf4afc","resolution":{"observed_at":"2026-05-10T21:07:32.396800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"XTuner: A toolkit for efficiently fine-tuning LLM","venue":null,"work_id":"7cc0eebf-6fc9-4813-ba97-ead513bc1b05","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:05dee59c33f757effcd1b2ef9a54afae92d794c024b029d7e29452f2f381a93c","observation_id":"6a6ad91b-a52d-4f01-b805-fbb1d5cbb9a3","resolution":{"observed_at":"2026-05-10T21:07:32.407334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual Dialog","venue":null,"work_id":"7588e99b-2c35-4cb4-a319-fe903b10353d","year":2017},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:5339c9d1bb344a50825d634c2c89c2a1a717377ee5c5a93d3bb04f9602162f55","observation_id":"51b5b339-38ff-4769-a2e3-ca0b0b0418e5","resolution":{"observed_at":"2026-05-10T21:07:32.419182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Project Astra","venue":null,"work_id":"df4f2f4d-88be-49ff-b2b8-8783447f92e3","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:f0a5ce2e9220cfd55a1b273b9c2fa416144aa84fb2e2990243e1736b254917b3","observation_id":"a846f329-e9b1-43a8-af1d-46ec64abd702","resolution":{"observed_at":"2026-05-10T21:07:32.431399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":"2305.14233","doi":"10.48550/arxiv.2305.14233","metadata_source":"pith","pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","venue":"cs.CL","work_id":"5b264119-de53-49d1-b7be-d172bf51c834","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:d8192031e2d329dec12dd8f581c10d1988f212d133b99f44c5c66ebb94163e7f","observation_id":"2f7e3cd1-450b-4dea-a3b3-1bd8887e5ca2","resolution":{"observed_at":"2026-05-15T17:25:08.436185Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:27.379194+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:27.379194+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06512","last_updated":"2024-04-09T17:59:32Z","snapshot_observed_at":"2026-08-06T19:00:20.787763Z","submitted_at":"2024-04-09T17:59:32Z","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","version":1},"cited_work":{"arxiv_id":"2404.06512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.06512","snapshot_observed_at":"2026-07-04T08:19:44.167431Z","title":"Internlm-xcomposer2-4khd: A pioneer- ing large vision-language model handling resolutions from 336 pixels to 4k hd","venue":null,"work_id":"799b1f12-2edc-4b09-a83b-dbd87e1404e7","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2404.06512","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:ddb14c341e6ba52b2d27143233489c45853e74b3bedde87260b2a6e476864d0f","observation_id":"dedd3424-8a32-42d5-8b5f-655daceeb726","resolution":{"observed_at":"2026-05-10T21:07:31.885344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01487","last_updated":"2025-02-05T09:06:42Z","snapshot_observed_at":"2026-08-05T04:29:05.120535Z","submitted_at":"2023-11-02T15:36:12Z","title":"What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.01487","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.01487","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What makes for good visual instruc- tions? synthesizing complex visual reasoning instructions for visual instruction tuning","venue":null,"work_id":"b64c7c78-d639-4205-963d-879ca81883df","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2311.01487","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:f9827c964a7a83ebbc553bcf9fe72215964fb6a75ac46849c68b844a687bb7d1","observation_id":"1e1aa477-1510-4eba-839a-5bcdcbce7081","resolution":{"observed_at":"2026-05-10T21:07:31.925047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:8d21cc8a9f0af173c4f68170d627afac7cdd0a1d296f3b1817bf90f65a526ab5","observation_id":"9767d1b8-3fdf-4106-9e9f-f54e9f8b517c","resolution":{"observed_at":"2026-05-10T21:07:31.933345Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are you talking to a machine? dataset and methods for multilingual image question","venue":null,"work_id":"a653d7f7-f76e-4256-8016-3e044930717d","year":2015},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:717fdf16465990e2f0afd095b85ee96dc569ec2469acf45753926a5913425748","observation_id":"1172e8f3-60a4-4156-ac72-91c7bbaab1e4","resolution":{"observed_at":"2026-05-10T21:07:32.440581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wukong: A 100 million large-scale Chinese cross-modal pre-training benchmark","venue":null,"work_id":"b00c8e92-6a68-4871-b278-f96cadf956ce","year":2022},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:18bf041ad09ffff6dc25c04f4db016fa720afbf940931c11d74cd8231afd6b5a","observation_id":"2fbbfae9-5780-4894-9976-efe49c0cef06","resolution":{"observed_at":"2026-05-10T21:07:32.450945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LVIS: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"973a94dc-1932-4f97-9de7-3aaa245f5c6e","year":2019},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:858d9e2b6614781893c68f18ca42cd03abde34836c0037a632814fb9d17ac212","observation_id":"c3aef501-530e-4603-8906-97730d27fdf0","resolution":{"observed_at":"2026-05-10T21:07:32.462756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synthetic data for text localisation in natural images","venue":null,"work_id":"6be69a8a-4949-476b-9078-ef3b9423b326","year":2016},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:779f2e903380f94ef1675650d1f7b2a975909f8e9e8885ca3c6a91ba36193b28","observation_id":"9191c5d4-7b6d-4061-ba8d-5918f928290f","resolution":{"observed_at":"2026-05-10T21:07:32.469780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VizWiz Grand Challenge: Answering visual questions from blind people","venue":null,"work_id":"72847982-b7eb-4064-b1f7-d51950b2ef0f","year":2018},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:6d054ea8cf4fa90b00e61ad9e11fe3f2e644861722672442c7fd3485d99f7ab8","observation_id":"c4cc5c2d-dbff-48dc-bd6b-5222c5cc02a5","resolution":{"observed_at":"2026-05-10T21:07:32.477931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-11T01:31:38.763116Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:ed381192cea9a19c1804c893901e9a613cd39ac39e0a4b4f46573a594316487c","observation_id":"452d07d0-b83c-43a4-a3bf-d1f59e28ffea","resolution":{"observed_at":"2026-05-10T21:07:32.169541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:96aa121b7b25f265ec34e748c457ddff60cc98238ca6289736d9927483af6953","observation_id":"6a91c791-6dcb-4108-9cd7-332b2482e400","resolution":{"observed_at":"2026-05-10T21:07:31.561356Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12038","last_updated":"2024-03-22T02:24:57Z","snapshot_observed_at":"2026-08-10T09:32:21.851571Z","submitted_at":"2023-08-23T09:55:41Z","title":"Large Multilingual Models Pivot Zero-Shot Multimodal Learning across Languages","version":3},"cited_work":{"arxiv_id":"2308.12038","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.12038","snapshot_observed_at":"2026-07-03T09:07:48.406083Z","title":"Large multilingual models pivot zero-shot multimodal learning across languages","venue":null,"work_id":"511113d3-4399-47e2-b249-e677d47e3feb","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2308.12038","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:21eb6740d38b7aced9f8d30e371d892059da8822e0a355b8eea1b53ad1c0fbe1","observation_id":"6897686f-a492-4a0a-b76b-623373621975","resolution":{"observed_at":"2026-05-10T21:07:31.619251Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":"2404.06395","doi":"10.48550/arxiv.2404.06395","metadata_source":"pith","pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","venue":"cs.CL","work_id":"f20a4304-bd39-414a-923b-d18322e29258","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:8cd3d0d3912b4ccb5087966baf6e58ddfeddbddccd7b0d978231c6f1e28da6dd","observation_id":"24e9067f-6f69-44f3-81ff-721ada57ac0c","resolution":{"observed_at":"2026-05-13T18:00:53.610624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language is not all you need: Aligning perception with language models","venue":null,"work_id":"2b47a012-f7cb-416e-8eef-aa77dc59e34f","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:ce7062936352fa5efd76db7616d5ddae551b07be69d978c341f0c759b3cb74a6","observation_id":"eb328202-6adb-41c7-ab38-2652989249c1","resolution":{"observed_at":"2026-05-10T21:07:32.490537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GQA: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"fef9d83f-7656-496d-aa90-5a11f0d45645","year":2019},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:67acf6531c32399620a075c013f3fbdfa5f537253dd4025cc38ee16ad649b4f4","observation_id":"b989c5f6-c14a-44da-85bd-01c596c8bac4","resolution":{"observed_at":"2026-05-10T21:07:32.496001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Phi-2: The surprising power of small language models","venue":null,"work_id":"8a377e83-949d-4400-b8c1-b887ff62f22c","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:f231afed89879d932166c32b3bb8f569b2ecff9d2119e2cc836329bb27a118fe","observation_id":"8d376466-b0cf-4a6e-add8-c76b5fa92038","resolution":{"observed_at":"2026-05-10T21:07:32.508354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CLEVR: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":"f9d0b628-24d4-4f0a-b0b9-7df07a27342c","year":2017},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:13f67b2ef939f812fc2e8489ff3dd0fbbfb8631258c8c163f3c3abf3cb3fc801","observation_id":"1e8a7373-4dde-4fde-99a0-715b65d2fd17","resolution":{"observed_at":"2026-05-10T21:07:32.516256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DVQA: Understanding data visualizations via question answering","venue":null,"work_id":"41e5db6d-3c81-4a9a-b87d-feae4caad18e","year":2018},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:d0741e4ac9a01c6f48e69308e0949c91490b97bf38b17aefa0733e560c0d98f8","observation_id":"4568e5b7-0b99-4622-9465-affb7d3bdcff","resolution":{"observed_at":"2026-05-10T21:07:32.520437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.07300","last_updated":"2018-02-22T22:50:42Z","snapshot_observed_at":"2026-08-04T06:17:25.388464Z","submitted_at":"2017-10-19T18:01:38Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","version":2},"cited_work":{"arxiv_id":"1710.07300","doi":"10.48550/arxiv.1710.07300","metadata_source":"pith","pith_arxiv_id":"1710.07300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","venue":"cs.CV","work_id":"aa4d846d-b19b-47d6-b5c3-1f61acf0a6a0","year":2017},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/1710.07300","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:ef920ba2087540c9941174e84c0762cfe14fd35d824326bfa0a84380be2772b5","observation_id":"bd2c8db3-1ec4-4d64-afaa-61abe9c4482f","resolution":{"observed_at":"2026-05-10T21:07:31.851490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"25e0e513-91e9-460f-8ff2-50487e2aeb3f","year":2016},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:0e0e59299ecfb4501c7135dad335427f79520988cf1201d5c1597b7be01a44d6","observation_id":"1eb88075-3e75-4ed5-84cc-b19b0d0101b8","resolution":{"observed_at":"2026-05-10T21:07:32.530256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OCR-free document understanding transformer","venue":null,"work_id":"fcac7204-4dc3-4baa-bc5d-6878af38c148","year":2022},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:3ed3501b36bf325d46225a22714410e6a497e7f33084caa8b7919602f1942848","observation_id":"e76bee8c-dae1-4278-ae31-d09346b64703","resolution":{"observed_at":"2026-05-10T21:07:32.534053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual Genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":"ec53aea4-a97e-4f80-a614-89a2f19eaccb","year":2017},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:95c5f8eb6543714fd357bfe034111be317b07a0b1ce0df1127423e1fa5ab3cf9","observation_id":"90b193fa-0014-41d5-b050-5e011aac1754","resolution":{"observed_at":"2026-05-10T21:07:32.537900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-08T17:33:57.727194Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":"2405.02246","doi":"10.48550/arxiv.2405.02246","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters when building vision-language models?","venue":"arXiv (Cornell University)","work_id":"d774cb51-7f06-48c6-9dea-33285f55ce87","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:715606d7f383383a50ba6a0d6495b089e8b4520320ae4322f2ef621ecfcb1f20","observation_id":"0a226c93-0c92-4f0c-9afa-1c63ec812ad7","resolution":{"observed_at":"2026-05-10T21:07:31.906488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLaV A-NeXT: Stronger LLMs supercharge multimodal capabilities in the wild","venue":null,"work_id":"59ff45db-9ff4-46f7-a761-c95691306c33","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:2842dc89d1c4bbabf1b16bcbe635a7a4d350d846a3cea3451fbd3b7931320613","observation_id":"35efb39b-ebae-42b7-98b6-aeec6161d9f8","resolution":{"observed_at":"2026-05-10T21:07:32.545656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BLIP-2: Bootstrapping language-image pre- training with frozen image encoders and large language models","venue":null,"work_id":"3dca3470-bad8-412a-b0bd-ffd68fc20ab2","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:8ba90990b9254430ceb65da87c5570571de289d9bc3607f5e589cf772be89867","observation_id":"595c9fd1-5b54-4283-8759-7ffa4cb2508b","resolution":{"observed_at":"2026-05-10T21:07:32.550042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00231","last_updated":"2024-06-02T15:47:16Z","snapshot_observed_at":"2026-08-10T02:42:21.966875Z","submitted_at":"2024-03-01T02:21:30Z","title":"Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2403.00231","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.00231","snapshot_observed_at":"2026-07-03T20:48:56.198380Z","title":"Multimodal arxiv: A dataset for improving scientific comprehension of large vision-language models","venue":null,"work_id":"4af8a742-b9ce-48eb-99e6-35eb96332561","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2403.00231","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:56b6490cbaa38bdf7419cabedcec07d418875210e070d48af65e741ce9af1691","observation_id":"60f2322e-4ed9-4fe8-ad74-0d9acc528876","resolution":{"observed_at":"2026-05-10T21:07:31.947656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":"2403.18814","doi":"10.48550/arxiv.2403.18814","metadata_source":"pith","pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","venue":"cs.CV","work_id":"70d699a8-f265-4862-b60f-3b62ca85f6d8","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:82677640224990765035e9f005788d20e764b7c1cf3f86e40743976dfdd56399","observation_id":"f39c6295-edc3-4756-815f-a84646d8a458","resolution":{"observed_at":"2026-05-17T07:44:47.683285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:07.759194+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:07.759194+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OpenOrca: An open dataset of GPT augmented FLAN reasoning traces","venue":null,"work_id":"d38996f7-b129-4f51-9fd3-5bece1085923","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:041c6d8897bf1987a922b2b0b0a809c8390dc1d31084e53aa2af4330bc9ea584","observation_id":"66b1e338-6978-4354-b961-c1cc452a5357","resolution":{"observed_at":"2026-05-10T21:07:32.554263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsoft COCO: Common objects in context","venue":null,"work_id":"827d1b83-f6b1-481a-add5-e6fde676ff7d","year":2014},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:3c8bcb73608ddd777ea4389a2fee6919464b6687019b2e1eab8d7e06fe32b494","observation_id":"18747935-8c71-42d1-b77d-21cb407e6c3f","resolution":{"observed_at":"2026-05-10T21:07:32.561696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-06T22:33:34.254048Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":"2306.14565","doi":"10.48550/arxiv.2306.14565","metadata_source":"pith","pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","venue":"cs.CV","work_id":"ba8e8164-e47f-42d6-83ad-696cb57ee79a","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:baf71cba52b35415320c9f7f031ac4e1c9def51ee2d4fa9a4c9fff88e142f68a","observation_id":"80d449a9-6083-4149-9464-8edb16df5c83","resolution":{"observed_at":"2026-05-14T17:34:57.031001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLaV A- NeXT: Improved reasoning, OCR, and world knowledge, January 2024","venue":null,"work_id":"a3549cc8-5e1c-400d-8a75-597546bc1c09","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:2d8b2dbdb41928e1654987d18e485ca04ed9ba963fa7f975890f557a891000cc","observation_id":"7c159ae6-3799-4fe7-8e23-f995a459016e","resolution":{"observed_at":"2026-05-10T21:07:32.570325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"e6326814-34ed-472b-91a0-9269afefca3c","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:7d2ce9c7e888ead049334a3125c9cee01ebc2464a479b44c57e3902c6f203fe6","observation_id":"73b1eb7f-48a0-4494-8f8a-6a90444479d9","resolution":{"observed_at":"2026-05-10T21:07:32.574275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":"2307.06281","doi":"10.48550/arxiv.2307.06281","metadata_source":"pith","pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","venue":"cs.CV","work_id":"3b44943d-0f15-4228-9ac3-0e376f4f9ada","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:d0f4511e65be2873f8c7d16ef21dc5b6a07f7c18fb33c0c4ada689e2e547fd7e","observation_id":"972b9836-c850-40e1-a6d8-e542c78caefd","resolution":{"observed_at":"2026-05-12T17:20:54.147488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":"2305.07895","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-07-01T22:26:17.944984Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","venue":"cs.CV","work_id":"521163e9-4c77-4c73-8b7f-9a6aa75b6d3b","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:76b9267577c2fd73534866462cf7a1527f1d6351b1596d6c7965e611ae10fc75","observation_id":"108de9e8-c92b-41a0-9cc7-4afe1ab1f30f","resolution":{"observed_at":"2026-05-17T09:55:36.035986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-09T20:40:14.205704Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":"2403.04473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document","venue":null,"work_id":"612fe156-781e-49f3-bac5-03fcb13d115f","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:9a5d36a083850d8363bc147f3d04ff0d596ca416c6cb81850d864e3c7f706abf","observation_id":"d0d22a99-2dca-4228-b9e2-14d19b081665","resolution":{"observed_at":"2026-05-10T21:07:32.096671Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14905","last_updated":"2024-06-27T03:53:46Z","snapshot_observed_at":"2026-08-07T05:13:11.135540Z","submitted_at":"2024-02-22T18:58:55Z","title":"MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases","version":2},"cited_work":{"arxiv_id":"2402.14905","doi":"10.48550/arxiv.2402.14905","metadata_source":"pith","pith_arxiv_id":"2402.14905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobilellm: Optimizing sub-billion parameter language models for on-device use cases","venue":"cs.LG","work_id":"1abbc148-f4d8-4865-86e4-5247b5824dd0","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2402.14905","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:73c894b11185224778aa0f5966f6d31ee55db3bb1811b5251c3f595276be9300","observation_id":"d30939c3-220d-4b71-877c-076d5f2ae595","resolution":{"observed_at":"2026-05-10T21:07:32.112611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"llama.cpp","venue":null,"work_id":"4d74d2f1-8bf0-41f3-b185-7add340c3b26","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:0a897b6859ef854fe033f6a17900e8d54e89a008bb843aa60fc6e57e51d73528","observation_id":"e601ca92-2c99-4e53-b93d-c3a399527b12","resolution":{"observed_at":"2026-05-10T21:07:32.580412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":"2403.05525","doi":"10.48550/arxiv.2403.05525","metadata_source":"pith","pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","venue":"cs.AI","work_id":"30da36a4-b9ad-4618-8955-c09232b61343","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:d1c5b0294aeac29e2ff5ad6ea5c2971268ae6c16e67b978d67793079adb3078b","observation_id":"ecfee39c-28c3-4995-a159-373accc69c08","resolution":{"observed_at":"2026-05-11T17:58:54.896552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13214","last_updated":"2022-07-25T04:05:29Z","snapshot_observed_at":"2026-08-02T20:16:21.986025Z","submitted_at":"2021-10-25T18:52:26Z","title":"IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning","version":4},"cited_work":{"arxiv_id":"2110.13214","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.13214","snapshot_observed_at":"2026-07-10T11:37:03.154319Z","title":"Iconqa: A new benchmark for abstract diagram understanding and visual language reasoning","venue":"cs.CV","work_id":"e5046a8f-5c72-46fd-baba-98ea6bce6d5a","year":2021},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2110.13214","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:6dc8b1dcf8ea49dd9032a8b6924c461e14c71c4144eb23527fef8db88e275473","observation_id":"08aad6d0-70cf-45d3-963b-3cede61bb950","resolution":{"observed_at":"2026-05-10T21:07:32.144606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"eeeea175-35b8-4738-ba9e-82e441d5104f","year":2022},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:51d8122fd48e19f3ece97e36a9a854d955ba833fa3abf6ebbb1e2086d192437e","observation_id":"bd8b2100-bb71-4035-9a94-90dd5cb602c0","resolution":{"observed_at":"2026-05-10T21:07:32.584267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:f6e9c05a71037cde5b4315d6e363fe9296f20e2e350aeb611b4d660f4128ed37","observation_id":"d7a5fec1-4360-4e16-af45-f8b29cce6e7c","resolution":{"observed_at":"2026-05-11T01:30:15.750849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OK-VQA: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"c96aca6a-13ae-419a-b5e9-41d278875797","year":2019},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:04bdaae1669f076419489285ab5815364170e639871ad62cb86b7ea1ffb6a0f6","observation_id":"e5d880a3-0c7e-4501-b2c3-2096a3c612c8","resolution":{"observed_at":"2026-05-10T21:07:32.593296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":"2203.10244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-07-04T16:39:57.602645Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","venue":"cs.CL","work_id":"8b49b78c-7e1d-4f57-af10-7c11cd63ff7c","year":2022},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:3bb9486b3381b526dad02510e24b809b9652933d4bf40dd5b375dee4cbf89ef9","observation_id":"ed6e5273-0706-47f2-a835-e7942e9d7337","resolution":{"observed_at":"2026-05-15T21:13:07.396442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DocVQA: A dataset for VQA on document images","venue":null,"work_id":"bdd3d77a-8250-4bbc-87b3-3faa6e54d4eb","year":2021},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:2e515601f136611e28e33f1692dae2c17897444be82eb55d52bca3c5554bd57d","observation_id":"67102baa-ddfc-4c7b-8bf0-0dfadfe77f77","resolution":{"observed_at":"2026-05-10T21:07:32.597181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InfographicVQA","venue":null,"work_id":"e934f0b8-c1ce-4bad-a46d-a391363f54e2","year":2022},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:199180eca9e3602c67626e3b90f014657b8655c381c6025d6c1c847e548bd2c8","observation_id":"4be4634d-1d1a-453e-84be-f7055a3b6735","resolution":{"observed_at":"2026-05-10T21:07:32.607246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":"2403.09611","doi":"10.48550/arxiv.2403.09611","metadata_source":"pith","pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","venue":"cs.CV","work_id":"378a250e-75a3-4ceb-b9a3-f8a5c2ed1a66","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:442be789e6a08be607eca9a8daf5946bc6b67b5ec95a787299dd1a2c24b4717e","observation_id":"5e3cba1e-776f-47fa-bcee-c681ddb079c6","resolution":{"observed_at":"2026-05-16T04:09:36.761640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OCR-VQA: Visual question answering by reading text in images","venue":null,"work_id":"2ef34397-9f0b-453d-ae55-4031e8f75507","year":2019},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:00627d31fd559b382c17da5e4fe84fdbc3a474df2167b12d95612d3a43821cb1","observation_id":"e1f8cdde-7050-4609-b96f-5a41929157cc","resolution":{"observed_at":"2026-05-10T21:07:32.618111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hello GPT-4o","venue":null,"work_id":"63dcc990-31cc-409d-96de-ee6773e27929","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:42388fe0f8e7aac8d93932e8ecfb480daccf0b6981984560d9868f09c90d0f71","observation_id":"7953d74d-16ee-486b-b36d-b37ae4009eaf","resolution":{"observed_at":"2026-05-10T21:07:32.628180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.00305","last_updated":"2015-08-03T02:53:01Z","snapshot_observed_at":"2026-07-06T04:25:37.491871Z","submitted_at":"2015-08-03T02:53:01Z","title":"Compositional Semantic Parsing on Semi-Structured Tables","version":1},"cited_work":{"arxiv_id":"1508.00305","doi":null,"metadata_source":"pith","pith_arxiv_id":"1508.00305","snapshot_observed_at":"2026-07-03T09:07:48.391901Z","title":"Compositional Semantic Parsing on Semi-Structured Tables","venue":"cs.CL","work_id":"294a0970-d89c-4466-8089-fa9561b72ee5","year":2015},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/1508.00305","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:b9d427d630a3061b309a9ffa6c0a138604a1e8d34a6e9eb4eca2f7b9f13eae76","observation_id":"3d48d524-407d-4de5-bc89-3faaa5014c54","resolution":{"observed_at":"2026-05-10T21:07:31.719136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":"2306.14824","doi":"10.48550/arxiv.2306.14824","metadata_source":"pith","pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","venue":"cs.CL","work_id":"46e7f9e9-24c6-49af-b7d5-96159fa6f443","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:1f9253d2348da7071c8bc0e90b8908ef893955ba4d66db93265ec0455531c357","observation_id":"a9217093-3703-4213-bf7b-d22d82177607","resolution":{"observed_at":"2026-05-12T05:19:48.115283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flickr30k Entities: Collecting region-to-phrase correspondences for richer image-to-sentence models","venue":null,"work_id":"e0826797-b9e5-47a0-b782-36b52c0b5d75","year":2015},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:e2f2b589e86486745840394f70764380a52bdcefdd58651cacbfbbdda3e8c58d","observation_id":"d9da07d1-7782-4963-8c3b-4695ac298cb6","resolution":{"observed_at":"2026-05-10T21:07:32.635121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"250901c3-8bfd-488d-bbe7-092542c529b3","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:0287bd1c05e4dbe5306aceb2c8aae878c290b5f0ac22b7ef4ea24900a1afa669","observation_id":"6104f17d-8b64-49db-94de-896a36f9551f","resolution":{"observed_at":"2026-05-10T21:07:32.644717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:f1318458b38ec399522242e19b53efc019732c11ef9c76138a695f1d188cbdf9","observation_id":"77c004ff-bcd5-447e-8f3f-5bb8b57d5a1d","resolution":{"observed_at":"2026-05-10T21:07:31.792365Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring models and data for image question answering","venue":null,"work_id":"1fcbb785-69e0-48e2-98eb-28efcfba55d1","year":2015},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:c4f27a9a041f13f885cfd0a4ccf00821f1d496581cbc183fa0c012c8c7c169e8","observation_id":"3de7390d-864b-452c-8809-b01ec83b88bb","resolution":{"observed_at":"2026-05-10T21:07:32.653121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-10T08:25:28.506770Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":"1809.02156","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-07-03T19:28:52.843969Z","title":"Object Hallucination in Image Captioning","venue":"cs.CL","work_id":"1027f299-c39b-4061-b0fd-32e237d53dbe","year":2018},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:da79d6f6f2169ee2886fe46aad6eeffa6e7a16543d4b00988b16c15ec842184a","observation_id":"85efcd41-1440-4f05-bd22-275b9eada7f5","resolution":{"observed_at":"2026-05-10T21:07:31.834351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"14bf9802-e348-4b48-9972-af6ac8bcfd2f","year":2022},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:4d0bd1530a1fcfc91569b7b1fe1a8e15daa82ad284d43c38a5149e37b9247e7b","observation_id":"12b3564d-545f-4c78-8024-5e80a4b08d17","resolution":{"observed_at":"2026-05-10T21:07:32.660227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A- OKVQA: A benchmark for visual question answering using world knowledge","venue":null,"work_id":"188f3240-a2c6-4647-9deb-e9498c4d4556","year":2022},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:04333ffe1f84cc5c8d9e9cbd6d343cdf62ad8c29f21b3b6dcc3199ba922f1d73","observation_id":"2bdffb64-52c6-44a3-8a61-d15a2729e7f4","resolution":{"observed_at":"2026-05-10T21:07:32.671540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"KVQA: Knowledge-aware visual question answering","venue":null,"work_id":"c8d94cba-bdd3-41cb-a942-27d165df9368","year":2019},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:10e328c0d71e09da59eca8041462f98303df8691a43f527975be552fe4bf8219","observation_id":"70168559-df60-4ac7-b5d3-ce0e027ef592","resolution":{"observed_at":"2026-05-10T21:07:32.683424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conceptual Captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"7764554e-9ee8-47a3-8425-c1b6d882750f","year":2018},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:8b0b65180caf45c7c46ee6daa97ba54addc1f7b5fc2b8cc8e9da8c522383be85","observation_id":"7f3bd094-031b-4813-9b5d-0230c43ae419","resolution":{"observed_at":"2026-05-10T21:07:32.690730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.06657","last_updated":"2016-09-21T18:12:04Z","snapshot_observed_at":"2026-08-07T02:41:04.460125Z","submitted_at":"2016-09-21T18:12:04Z","title":"The Color of the Cat is Gray: 1 Million Full-Sentences Visual Question Answering (FSVQA)","version":1},"cited_work":{"arxiv_id":"1609.06657","doi":null,"metadata_source":"pith","pith_arxiv_id":"1609.06657","snapshot_observed_at":"2026-06-29T08:23:15.060489Z","title":"The color of the cat is gray: 1 million full-sentences visual question answering (FSVQA)","venue":"cs.CV","work_id":"e9ba2f2c-e5e2-406c-9930-512290b6a331","year":2016},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/1609.06657","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:c0495bb139a439618ef0f8075338be497b56a40422ffdd6fd36386934e448029","observation_id":"ec631bd9-21bf-42c6-b7a1-6e73cc112ba4","resolution":{"observed_at":"2026-05-10T21:07:31.898348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards VQA models that can read","venue":null,"work_id":"7cb6a071-90a4-4e31-a2fd-1e1adfa2c442","year":2019},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:9484d432b8289ca4657c68c64a314dad159178eb0992e03dc65ed25139843c0e","observation_id":"d2f2ca94-04eb-4fff-aad5-b6ea29ea52eb","resolution":{"observed_at":"2026-05-10T21:07:32.697129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"WIT: Wikipedia- based image text dataset for multimodal multilingual machine learning","venue":null,"work_id":"ad4e272e-b640-4219-b31b-d335938265a3","year":2021},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:f7e5e976501bc42871a2d14b433426633ea105affc5aeef38f66c93e9ecff46b","observation_id":"26fbc4bd-1578-4bdf-ad1a-c58ece692a1e","resolution":{"observed_at":"2026-05-10T21:07:32.196533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kleister: Key information extraction datasets involving long documents with complex layouts","venue":null,"work_id":"1f4d6d97-8396-40a7-b3dd-35a76a6107b0","year":2021},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:27427969c1b439b00074f916f6e23ba44f427c9f873f02063241cf1dd3784384","observation_id":"243de297-b9e1-40fc-adb5-860457ac4de1","resolution":{"observed_at":"2026-05-10T21:07:32.204385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A corpus of natural language for visual reasoning","venue":null,"work_id":"29a49853-ca25-45b3-ac45-54770a76af7a","year":2017},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:49da67e9508d23baeeffe8efd63c37c131ef4c9bcf0dbc1178ea049417b08b6e","observation_id":"68dc5eae-f051-4d5c-b852-f1d588b0235e","resolution":{"observed_at":"2026-05-10T21:07:32.208539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepForm: Understand Structured Documents at Scale — wandb.ai","venue":null,"work_id":"a95d9eaf-5291-496a-ac9e-a4ac3be4a4e6","year":2020},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:6321b3a1c815b81cee3a32cd45670d89eef35ee75c30905e6a107651255527aa","observation_id":"28e659e5-ed22-443f-97cd-a2507c035fc1","resolution":{"observed_at":"2026-05-10T21:07:32.215102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VisualMRC: Machine reading comprehension on document images","venue":null,"work_id":"783308ce-0942-494b-b36c-e7cd07ddc2aa","year":2021},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:0e0cb78739750ab0139f88f9520e6c30f1978121f77174cef44a57af245caeaa","observation_id":"a9c90a9f-e3c2-4438-8d2a-5a55daed2f9d","resolution":{"observed_at":"2026-05-10T21:07:32.222421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hashimoto","venue":null,"work_id":"fbc9aa98-c2e7-4bcf-bc2a-acd1812e929a","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:80f5969b987728ec553908e94fede84dec2a7c92bee32f9b6bf9e465b1163898","observation_id":"244bce56-2d6c-4971-8faf-508c6e5ac84e","resolution":{"observed_at":"2026-05-10T21:07:32.228083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OpenHermes 2.5: An open dataset of synthetic data for generalist LLM assistants","venue":null,"work_id":"a18b540e-e1d8-4649-a53b-bdcf29306acd","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:6eb09948cf43ed16d049d13e96935b6a67e309cc12274aa4b8b7fe3949a1678e","observation_id":"8aee351b-0802-46e4-a451-8e48a0a876b3","resolution":{"observed_at":"2026-05-10T21:07:32.234390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2406.16860","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-07-03T23:49:02.295501Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","venue":"cs.CV","work_id":"f305b8a2-d78e-4bf3-b9fd-41777382e536","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:dc42f7ede7fcca9b1b357a241130f14202a5e65d032e51a889e8c1caa01a598e","observation_id":"cbd8a619-6209-4510-84c8-8018e97c2510","resolution":{"observed_at":"2026-05-17T00:05:04.345806Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:1ad11dfc2b4ca4b0813b54d520bfa1b958158808a928d9bd8d94e6ddcd5e94e2","observation_id":"494deac7-1827-46a9-ba61-cf7e3669be38","resolution":{"observed_at":"2026-05-10T21:07:32.013557Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:0f7120d811453097d83e2b48c4367bf6c2fdf398bd083ffd172f5327a2cd1ced","observation_id":"deb21c91-904d-45f6-8645-10e8fbfcab8d","resolution":{"observed_at":"2026-05-10T21:07:32.019589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":41,"verified_fuzzy":58},"total_outbound_references":121},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 121 outbound references and 100 inbound Pith citation observations for arXiv:2408.01800."}