{"as_of":"2026-08-06T02:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a4e281e67aa38c80a6130714b4ac741e1e82eb481b49b119e098e4963d1d81e1","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T20:18:15.439163Z","state":"measured"},{"denominator":153,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":153,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":63,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:24:39.631783Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T20:19:27.255515Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2404.14219"},"observation_digest":"sha256:aff39fdd98127ed02dd2665b58c627e0c4d79c9ff1955062e22d959697485665","observation_id":"449cc6a2-7af6-44e2-8b8c-60d35ee072a1","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-03T15:14:54.643258Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T01:09:30.360275Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2406.09411"},"observation_digest":"sha256:7299229f7dc727c5cbc476900a76d14793006f9a66263074d43646391d5db793","observation_id":"db3428af-e77a-4f8a-995c-184368d595ba","resolution":{"observed_at":"2026-05-17T01:09:30.442631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T14:56:33.945280Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2406.09414"},"observation_digest":"sha256:aceacd13073307cdf19aa5e20ab36fbf75b1820d8b77f28e770ecb1d5c8c69f3","observation_id":"f2da540d-4c8c-4aa0-8482-62bf96050759","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T00:05:03.547664Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2406.16860"},"observation_digest":"sha256:16092dfd86737a109d181f098d9e682cccd38804c5a5f53fdb8542cb8ed23d6d","observation_id":"35fbd366-aacc-42ef-8c5b-3de03abd4298","resolution":{"observed_at":"2026-05-17T00:05:03.712019Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:17ef2991b148ef8a8890f86e2ec3670ab8fb129f146783880287917d40af2d2f","observation_id":"2490bbe3-8e77-4a4e-ae5a-95e5937f0c81","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:dabc7eb39168cbe8565c339de87931bbcdddc06b5913188825bfff228ab5bedc","observation_id":"d256730f-a2e3-4983-90d8-0043a8ba6f24","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T07:59:32.638758Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2408.13257"},"observation_digest":"sha256:2dc28d9e2609c86100439ba6c5f98999320b15b86db224d2500bee091732f8d3","observation_id":"a910a12c-9f03-4125-b335-711b47e51e93","resolution":{"observed_at":"2026-05-16T07:59:32.699685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-14T00:51:48.163349Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2409.02813"},"observation_digest":"sha256:126423353f5477d84b50743c4875db8090b8ba2192d42ea0cc999a06411aaa13","observation_id":"02f44911-d49a-470d-b4a6-7515bb7319a4","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:305dd3177df0480dee4b4af3eb3fc1bb53c84c6ebba325fe31ce2d340149bf95","observation_id":"b97e81f7-0bde-406c-b183-6b7e09787a8c","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"reference_index":258,"source":"arxiv_source","source_observed_at":"2026-05-17T07:51:12.953777Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2412.14164"},"observation_digest":"sha256:1b56830cb59c4837e9bbe3b669f668d4beb7024afd24c65c722a515d12cea507","observation_id":"d9b79575-df07-451c-ab2a-4b28228f0063","resolution":{"observed_at":"2026-05-17T07:51:13.207957Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:86311a4645cb298469649c397f922e784bd245e5ca9cd9ed77afa95211a34698","observation_id":"cb91d072-e5e7-429c-b9d4-f256aecc44af","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T22:18:55.976503Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2503.19786"},"observation_digest":"sha256:58fd588c182491b621bb5f386d66e56c9ccafba63af39a2e543711283c9523ee","observation_id":"2637342f-824d-4ee1-8cec-4d9dbe651456","resolution":{"observed_at":"2026-05-22T22:22:12.223017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:7c3c074b1ee15e21cfbc9fadce506983988c62d512bc0cb5e7994942744aaa27","observation_id":"2a242639-a304-471e-8c5f-5b5ad78f44e1","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-02T04:30:21.704758Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T01:05:18.801388Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2505.23678"},"observation_digest":"sha256:68fe9b54975a675cb26539d0433a9b1db0804639a43f70dfad366c733b2df342","observation_id":"3024c293-8945-492a-9bb2-c065a21ddb9c","resolution":{"observed_at":"2026-05-22T01:05:52.174278Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:57519a05a9f2bd3c7752e266fd67cd3f46b5c0f7f01606cfe81c8cd89359289e","observation_id":"7095c77d-5117-459b-ac10-881acf5f2746","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2507.01955","last_updated":"2026-05-01T00:57:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:59:07Z","title":"How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T05:55:09.188048Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2507.01955"},"observation_digest":"sha256:8a66ff98b623ba787f79aa8552017a7cb57fafa3680dc652dfcbece14961146e","observation_id":"84230edf-4209-4308-9141-436bcd19977b","resolution":{"observed_at":"2026-05-19T05:57:08.011869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T11:58:58.660564Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2508.18265"},"observation_digest":"sha256:c7833a80e35fa80b6818e2be2de232ea83c281f5932f69826dfb861cb12a3643","observation_id":"d517cdae-32fd-4521-a495-ce6109d7355a","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T13:24:39.631783Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-05T13:24:37.779805Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.631783Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:faefd95f6baf53e0c0ad6136cd834d91130c73f129cfb45f41ddf578792ab858","observation_id":"b3588781-8ee6-4566-963c-9e74225587a6","resolution":{"observed_at":"2026-08-05T13:24:39.631783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T12:27:04.924950Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01656","last_updated":"2025-09-01T17:57:49Z","snapshot_observed_at":"2026-08-06T02:38:32.042356Z","submitted_at":"2025-09-01T17:57:49Z","title":"Reinforced Visual Perception with Tools","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T12:27:04.924950Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2509.01656"},"observation_digest":"sha256:1078279e36d139463b4d34c8be550a1b55934797b96d742f3e7eae21e224f1f0","observation_id":"e48ae2b1-7886-4639-8cb2-d9c322917be1","resolution":{"observed_at":"2026-08-05T12:27:04.924950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T11:56:08.613463Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02175","last_updated":"2025-09-04T16:38:44Z","snapshot_observed_at":"2026-08-05T11:56:06.572610Z","submitted_at":"2025-09-02T10:32:58Z","title":"Understanding Space Is Rocket Science -- Only Top Reasoning Models Can Solve Spatial Understanding Tasks","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T11:56:08.613463Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2509.02175"},"observation_digest":"sha256:fa1266e29a4613c2cbc618e4f200edc9b9b630e2c7cf4e1fb5c05ffe828e90a2","observation_id":"3e8d8889-933c-49ba-96c7-2b7824e177ec","resolution":{"observed_at":"2026-08-05T11:56:08.613463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-03T23:08:49.532620Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:49.532620Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:dd856eba975e368ed7d11d917165f4e0e63523ca6b9b9221c4d43d1faef71b3e","observation_id":"80da89b1-98fb-43e9-8400-1d37f0472ea6","resolution":{"observed_at":"2026-08-03T23:08:49.532620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2511.10946","last_updated":"2026-04-15T01:06:55Z","snapshot_observed_at":"2026-08-03T12:49:21.604140Z","submitted_at":"2025-11-14T04:16:09Z","title":"Abstract 3D Perception for Spatial Intelligence in Vision-Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T22:43:16.761970Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2511.10946"},"observation_digest":"sha256:1c93226c908ee1ccf048150adf2573f2d515278aa926d615b7eb028cb1eefbac","observation_id":"f0d3fd3c-a303-42f7-b729-f26b80345f4b","resolution":{"observed_at":"2026-05-17T22:45:24.419680Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-03T18:42:11.109093Z","title":"Blink: Multimodal large language models 9 can see but not perceive.arXiv preprint arXiv:2404.12390,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04069","last_updated":"2026-06-01T16:57:23Z","snapshot_observed_at":"2026-08-03T18:42:08.737584Z","submitted_at":"2025-12-03T18:50:04Z","title":"SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T18:42:11.109093Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2512.04069"},"observation_digest":"sha256:1715b4db6d3e0b39e8bd174d6b41e64fca03c0504af79a03924568ff3e50e9ea","observation_id":"c8e4af68-f378-4907-8e8f-4673229054ca","resolution":{"observed_at":"2026-08-03T18:42:11.109093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2601.09536","last_updated":"2026-04-18T07:44:28Z","snapshot_observed_at":"2026-07-06T22:41:43.594456Z","submitted_at":"2026-01-14T14:57:33Z","title":"Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T14:37:05.402850Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2601.09536"},"observation_digest":"sha256:282e1205dd5ca000b0be8f612ff50c2af89bbdb7d910531fadd0ea9080763be3","observation_id":"ef67d5fd-d15f-4fda-b4b0-c5ab2d75330a","resolution":{"observed_at":"2026-05-16T14:37:59.940145Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T16:09:05.225767Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2602.02276"},"observation_digest":"sha256:8f494576d9188c57e7d5cc57efa3d54cf33cac63ca06641a46a1eb2a4d22c992","observation_id":"ac112fd3-56c9-4fba-b4f9-128456022928","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2604.00799","last_updated":"2026-04-02T21:20:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-01T12:06:54Z","title":"Multimodal Language Models Cannot Spot Spatial Inconsistencies","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-13T23:12:27.333405Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2604.00799"},"observation_digest":"sha256:51a65d8cf3ba950840fd93832b0aa57cbc5ba77e0a352cdcd9578814abee3b23","observation_id":"fcab69be-4460-4126-8fe5-a1838387d2b4","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2604.20012","last_updated":"2026-04-21T21:40:58Z","snapshot_observed_at":"2026-07-06T23:06:31.110859Z","submitted_at":"2026-04-21T21:40:58Z","title":"EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T02:16:08.687340Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2604.20012"},"observation_digest":"sha256:43da758ae585c860e71729db010743f877724ffcb58e27e35c941c9606d59821","observation_id":"cb7da1c8-5250-4d3a-88a7-3395600d6638","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2604.24583","last_updated":"2026-04-27T15:08:02Z","snapshot_observed_at":"2026-07-06T23:10:33.821313Z","submitted_at":"2026-04-27T15:08:02Z","title":"Improving Vision-language Models with Perception-centric Process Reward Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:36.634359Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2604.24583"},"observation_digest":"sha256:b38529b49b3900872bedf2b23ad84b6cbe52a223453bd3921d3095b75d7b5ddb","observation_id":"5c7952db-71b9-4556-b907-5c59a7f6b83a","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:a63900a29e727eb528068c6c24eb4ccfbcc7d799bb0261520aa08413bc410b66","observation_id":"ed1cadea-6207-4b5c-8aa3-40ecee404002","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.04075","last_updated":"2026-04-14T08:17:53Z","snapshot_observed_at":"2026-08-03T03:08:39.084770Z","submitted_at":"2026-04-14T08:17:53Z","title":"RetentiveKV: State-Space Memory for Uncertainty-Aware Multimodal KV Cache Eviction","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-10T15:29:17.567557Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.04075"},"observation_digest":"sha256:d005c79d964ad559f2012ac8a4b619c9bfe90312d69f6de28a0d27a2fd802c5f","observation_id":"ac8a1ce3-7d20-450c-90f2-fe7fab2e5efc","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.09883","last_updated":"2026-05-29T22:33:55Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:16:48Z","title":"The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T04:30:54.053958Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.09883"},"observation_digest":"sha256:3179327fc1554f6076924dcc4e157209d7126aeca3d6727e6e19a07ce9087251","observation_id":"d57cdf37-8b01-47fa-bdff-def804182c4c","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.09883","last_updated":"2026-05-29T22:33:55Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:16:48Z","title":"The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T22:58:04.574536Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.09883"},"observation_digest":"sha256:6fb2b16968ffa4561404e7f41096752acf25a17d81f40de64c3a2b1bc61322ba","observation_id":"5a4ce0a0-ebc7-45a1-9d80-6b86ae9c5d7e","resolution":{"observed_at":"2026-07-01T13:35:46.604914Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T02:52:43.674969Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:5f5b35bbe252d9d9ffbeadc26420a30c7d18535f0eef187723454928c6a834a0","observation_id":"653ca010-be3a-4fd0-8c2c-ccb7b67d391b","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T21:28:37.680681Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:3ce18c46cba108cdcbcbfa8002712ab58a521a92e0983cde99744d2e51bb2c82","observation_id":"5de67ce0-c44b-4ec6-8abc-43c140d464b1","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.16403","last_updated":"2026-05-13T05:00:19Z","snapshot_observed_at":"2026-07-06T23:27:34.514541Z","submitted_at":"2026-05-13T05:00:19Z","title":"When Vision Speaks for Sound","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T22:12:52.160596Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.16403"},"observation_digest":"sha256:19a3e897e4f129af88c4547f983a442516a873316aa8794afd18d54f51c7e591","observation_id":"0680746e-0946-49b5-982f-d46c5df6dcb0","resolution":{"observed_at":"2026-05-20T22:13:46.799961Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.18445","last_updated":"2026-05-19T10:08:18Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:14:49Z","title":"What's Holding Back Latent Visual Reasoning?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T11:59:14.134917Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.18445"},"observation_digest":"sha256:85fde6aa881ce5254614704cd06140a7d7e265c1e34af9e0a337587d271b99d5","observation_id":"32f15706-6d81-4527-a732-c653269f5fe0","resolution":{"observed_at":"2026-05-20T12:03:15.479718Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T11:32:24.007847Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:5af58ed3050c8f7ab307131a607122b243c81508ae2c0fcd6ab6b7fdd166d67f","observation_id":"45972e6c-4f3a-49ce-ad25-59e5e90a968d","resolution":{"observed_at":"2026-05-20T11:33:14.185570Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:75b13dc2979e03da3bd51561410e99795324a5272c154ce3b113fbaa93af8586","observation_id":"41f4ffe9-b6b8-4ff8-819f-eb9b5000c5c0","resolution":{"observed_at":"2026-06-30T18:35:00.371150Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.18746","last_updated":"2026-05-25T08:34:52Z","snapshot_observed_at":"2026-08-02T07:58:31.278661Z","submitted_at":"2026-05-18T17:59:02Z","title":"ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T10:52:22.778489Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.18746"},"observation_digest":"sha256:f42590699b5d234557b80654f6c91508dbf753bca84a6163996a2777e4f2e006","observation_id":"7ab9d2bd-131f-4b57-bd9f-16c354b70c5e","resolution":{"observed_at":"2026-05-20T10:53:13.208797Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.18746","last_updated":"2026-05-25T08:34:52Z","snapshot_observed_at":"2026-08-02T07:58:31.278661Z","submitted_at":"2026-05-18T17:59:02Z","title":"ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T18:25:17.831116Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.18746"},"observation_digest":"sha256:72b9bcb2db41915d7f719c16c8f443e9f5a22599bd5618933cf04d865eba9b09","observation_id":"c2a322ea-d23f-496d-8dcc-18c43c501de5","resolution":{"observed_at":"2026-07-01T15:05:47.176193Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T08:36:27.676888Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:8e89385d9c284b41e40e39764d99f9c19d2634a948ee1cc537de859f1414c701","observation_id":"7ad6f110-2913-4142-bc38-ab555372727b","resolution":{"observed_at":"2026-05-21T08:39:53.709641Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:67a4c384d29f7d809afaf11e5fffef31f6f73718ad7769d38e63ea809ea560d4","observation_id":"b280e90a-091a-4308-a785-3ce2c8c263d9","resolution":{"observed_at":"2026-06-30T18:04:58.341972Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.30639","last_updated":"2026-05-28T22:42:38Z","snapshot_observed_at":"2026-07-06T23:39:53.132531Z","submitted_at":"2026-05-28T22:42:38Z","title":"PInVerify: An Offline Embodied Benchmark for Active Instance Verification","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T07:30:59.306097Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.30639"},"observation_digest":"sha256:57528e9be611b3d05d9de469f6b710a047a5210658f44b44115b77bc146c4c49","observation_id":"870f1a3d-4d80-4c90-9713-611b8411423a","resolution":{"observed_at":"2026-06-29T07:33:13.552711Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-06T02:16:44.489934Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:f2c869a162e38602f1a50aaf536824a5ff594ad5d5e5b8d19ef00fdee240bbdd","observation_id":"508d172c-b047-4f6a-9dad-28b2652407c4","resolution":{"observed_at":"2026-07-02T17:37:14.727108Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-07-14T18:07:09.018997Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11324","last_updated":"2026-07-11T14:44:40Z","snapshot_observed_at":"2026-07-16T23:17:53.174457Z","submitted_at":"2026-06-09T18:07:50Z","title":"Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-14T18:07:09.018997Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.11324"},"observation_digest":"sha256:9db8eba6c0b42bec25ef0a06d657d2ebcd34a21bb47d7884ae5cec723ab7c215","observation_id":"b148aae3-f0e4-4bae-aa81-fc50c8314a12","resolution":{"observed_at":"2026-07-14T18:07:09.018997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.12025","last_updated":"2026-06-11T09:50:37Z","snapshot_observed_at":"2026-08-02T03:26:16.692806Z","submitted_at":"2026-06-10T12:48:27Z","title":"Human-Enhanced Loop Modeling (HELM): Agent-Based Finite Element Modeling of Concrete Bridge Barriers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.12025"},"observation_digest":"sha256:76e22f7bf6ce09d8242797e5fc4e5f9c772d3930b76f47218468702340945ce6","observation_id":"6351c0a6-442f-44bf-bf28-b82b86efef77","resolution":{"observed_at":"2026-06-27T09:50:49.101338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.17539","last_updated":"2026-06-16T05:32:39Z","snapshot_observed_at":"2026-07-06T23:53:07.149182Z","submitted_at":"2026-06-16T05:32:39Z","title":"Reinforcing Dual-Path Reasoning in Spatial Vision Language Models","version":1},"reference_index":126,"source":"arxiv_source","source_observed_at":"2026-06-27T01:42:30.005911Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.17539"},"observation_digest":"sha256:eb64faf51c325e6e8beb27691bdde67bd038946a3b09e9fbde2d3abedd2b9a21","observation_id":"10e1f930-285b-421e-babd-a0e88f519f27","resolution":{"observed_at":"2026-07-03T20:08:55.668706Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.18974","last_updated":"2026-06-25T02:14:41Z","snapshot_observed_at":"2026-08-02T20:17:43.258482Z","submitted_at":"2026-06-17T11:59:15Z","title":"Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-26T21:47:51.437284Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.18974"},"observation_digest":"sha256:5198ee2619ebadf66125e4ba0650652cc7f08856db9860d09f04fb56167a7f79","observation_id":"fdc46151-68b7-4d87-a1d1-123208f6c79c","resolution":{"observed_at":"2026-07-03T23:49:02.264842Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.20515","last_updated":"2026-06-28T15:54:03Z","snapshot_observed_at":"2026-08-02T07:26:05.359571Z","submitted_at":"2026-06-18T17:34:55Z","title":"S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T17:56:07.864580Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.20515"},"observation_digest":"sha256:8909510dcb54753af3798380102bb04a92412df519e705af3f02b82fa5dce15e","observation_id":"13ac3131-27ae-4e06-b3cf-71889a166f29","resolution":{"observed_at":"2026-07-04T03:29:31.569062Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.20515","last_updated":"2026-06-28T15:54:03Z","snapshot_observed_at":"2026-08-02T07:26:05.359571Z","submitted_at":"2026-06-18T17:34:55Z","title":"S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T10:22:08.535453Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.20515"},"observation_digest":"sha256:7df581043f988592287caa15b43931dc2be93c9d0304a74de1ee6fb6650e52fd","observation_id":"d41550c2-7965-45d5-9bed-ea092705becc","resolution":{"observed_at":"2026-06-30T11:54:39.058350Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:0332c282452ab60bf3ebc8419083345f3ef590edbe32780d87553070f0beffec","observation_id":"a7bf10db-3965-469f-9212-8b0376aa8f1e","resolution":{"observed_at":"2026-07-04T03:09:30.076334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.22043","last_updated":"2026-06-20T13:48:19Z","snapshot_observed_at":"2026-07-06T23:56:59.635251Z","submitted_at":"2026-06-20T13:48:19Z","title":"When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T11:43:17.464276Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.22043"},"observation_digest":"sha256:6bd01d971c57bd3754f344713810307b4c00880dd4a7e47e88c13fa21f37b568","observation_id":"9b6bcb5c-80c8-492c-b2eb-08e16619da25","resolution":{"observed_at":"2026-07-04T08:29:41.287801Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.24253","last_updated":"2026-06-26T09:37:54Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T07:42:22Z","title":"TuringViT: Making SOTA Vision Transformers Accessible to All","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-29T05:32:26.746776Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.24253"},"observation_digest":"sha256:60a11325def8325305b592fa1ca7489ed3319ce5f3111a12c87583390fe1cc60","observation_id":"65ca5b1c-22f4-4574-a1e6-af195f0604d6","resolution":{"observed_at":"2026-06-29T15:03:32.200965Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.25066","last_updated":"2026-06-23T18:19:16Z","snapshot_observed_at":"2026-08-03T16:49:49.430308Z","submitted_at":"2026-06-23T18:19:16Z","title":"Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-25T22:58:41.991573Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.25066"},"observation_digest":"sha256:b49240f3ce18334e1cac47cb2bd3ebdd58b246cf7dae8e9d911c4e45a1d55fba","observation_id":"f0acdfa3-2518-438c-9d35-bf02dd304185","resolution":{"observed_at":"2026-07-04T18:10:02.344679Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.25445","last_updated":"2026-06-24T06:15:24Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:15:24Z","title":"C3-Bench: A Context-Aware Change Captioning Benchmark","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-25T21:02:52.529391Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.25445"},"observation_digest":"sha256:373b8f58e29a42e67ad8588b1314ea54e20f835a0ac6c76e86fde0e862d2266f","observation_id":"f79a77b4-41dc-4519-8def-0f5e1e5622ac","resolution":{"observed_at":"2026-07-04T19:50:10.197607Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.26602","last_updated":"2026-06-25T05:02:38Z","snapshot_observed_at":"2026-08-05T11:23:05.305941Z","submitted_at":"2026-06-25T05:02:38Z","title":"DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T05:18:01.931929Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.26602"},"observation_digest":"sha256:29bd4161d6b5f0e9966acb6591a925406a72b9f874a43ac0c34c4c70771a1480","observation_id":"5ae8d44e-6985-4875-b221-1261d8c47ec4","resolution":{"observed_at":"2026-07-04T13:19:50.970106Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2607.00576","last_updated":"2026-07-01T07:59:45Z","snapshot_observed_at":"2026-08-05T12:04:26.976147Z","submitted_at":"2026-07-01T07:59:45Z","title":"Safe Alone, Unsafe Together: Safeguarding Against Implicit Toxicity When Benign Images Combine","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-02T13:19:29.775959Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2607.00576"},"observation_digest":"sha256:ed55d460598c65c4b05445809eb08840989aa6643eef9493ce77a95f780d3463","observation_id":"6265e2a3-e2ac-48c7-afb9-a4c84b86d857","resolution":{"observed_at":"2026-07-02T13:26:58.578997Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"ArXivabs/2404.12390(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-02T18:53:38.421944Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:5852e864554b9795d388a1a638e304e663be762ce2cf40b76f738a8e08acb99c","observation_id":"ae5cf0f9-eb9a-47b2-9552-76e22787a979","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-07-14T07:59:56.441098Z","title":"arXiv preprint arXiv:2404.12390 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10966","last_updated":"2026-07-13T00:21:30Z","snapshot_observed_at":"2026-08-04T00:19:49.524589Z","submitted_at":"2026-07-13T00:21:30Z","title":"SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-14T07:59:56.441098Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2607.10966"},"observation_digest":"sha256:d6764c839946db308188580f625ce7e1c52edf2ce585e6874edef92d4255d42b","observation_id":"21908eb4-c7c1-4ead-a2f4-43266c6052d7","resolution":{"observed_at":"2026-07-14T07:59:56.441098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-01T21:12:03.439176Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16165","last_updated":"2026-07-17T17:46:23Z","snapshot_observed_at":"2026-08-05T12:06:47.948888Z","submitted_at":"2026-07-17T17:46:23Z","title":"An Exam for Active Observers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T21:12:03.439176Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2607.16165"},"observation_digest":"sha256:0f5b9dbe2027e910cf0e97f9dc68c92f0f4bd4a314b8c48465d3aa13d4adf38b","observation_id":"3e4cd782-5ba3-4906-b57b-b3866b366861","resolution":{"observed_at":"2026-08-01T21:12:03.439176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-02T06:33:14.400943Z","title":"Fu, X.; Hu, Y.; Li, B.; Feng, Y.; Wang, H.; Lin, X.; Roth, D.;Smith,N.A.;Ma,W.-C.;andKrishna,R.2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-02T14:55:22.478767Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:14.400943Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:809273aecfdc666b0c88fad3ea254426441d21b67c2762555e10a77d916320cc","observation_id":"968911c8-70be-4eee-8090-d09f98d0d120","resolution":{"observed_at":"2026-08-02T06:33:14.400943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-01T11:47:23.095760Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-03T23:34:43.913899Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:23.095760Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:3d56fdd160dae71af8f9e8c4129a23af340d31887e847fc7f0c1fb6b594da43e","observation_id":"fb24cba7-7b31-4c49-be5a-c6f5f1953e27","resolution":{"observed_at":"2026-08-01T11:47:23.095760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-07-30T12:20:51.527995Z","title":"arXiv preprint arXiv:2404.12390 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27145","last_updated":"2026-07-29T17:20:56Z","snapshot_observed_at":"2026-08-01T23:41:39.569943Z","submitted_at":"2026-07-29T17:20:56Z","title":"Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-30T12:20:51.527995Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2607.27145"},"observation_digest":"sha256:e16779e61603f069e603912ac656ac79d1b51310a14055191d39bcf9f61c8ed9","observation_id":"933e3f93-953b-4aa7-b85e-f48e1221ae1d","resolution":{"observed_at":"2026-07-30T12:20:51.527995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.12390/citation-record","integrity":"/paper/2404.12390/integrity","json":"/paper/2404.12390/citation-record.json","paper":"/paper/2404.12390"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f8bea833-ebe2-4366-aa34-0ae3433f6dc7","year":2024},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:6c898513843d82107559d23aa46d8fff205046c37bda67c4253738067028efd4","observation_id":"fcf71cd7-bd5a-48a6-857f-95277b0fa783","resolution":{"observed_at":"2026-05-15T20:18:15.762219Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: AAAI (2019) 10","venue":null,"work_id":"365c08d1-df9d-4bc5-859b-42eb662a253d","year":2019},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:c0c17458d85002546456055a06574abecd8129fd889abf7c3d247a45cf286d6c","observation_id":"93d55819-5eef-47df-922c-cecf99ea015b","resolution":{"observed_at":"2026-05-15T20:18:15.768026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems35, 23716–23736 (2022) 2, 4, 22","venue":null,"work_id":"88ba30a1-83ea-4142-9669-25cd7d6dffa5","year":2022},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:9d5dfc1d7896b2e66a3f44a94c6e752328803155b8fe92cbd0290b1824f13c99","observation_id":"dfe95755-cdf2-487f-b0d0-d6ae0c098bae","resolution":{"observed_at":"2026-05-15T20:18:15.771138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE international conference on computer vision","venue":null,"work_id":"a8727b08-59c4-43f9-b90a-a33fa63ffb0b","year":2015},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:691dd2f8430a1178c7d897256cee1e472a3644ad9d99216ca849fddee005fd85","observation_id":"f55ea2a4-f1c8-482a-b894-d35b1898c965","resolution":{"observed_at":"2026-05-15T20:18:15.773873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2308.01390","doi":"10.48550/arxiv.2308.01390","metadata_source":"pith","pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","venue":"cs.CV","work_id":"87bfa84a-e663-4165-806f-93ef439d88d0","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:0d20c9a9a96e6cc216a5240d2d69909c2185adcaa7aa1d3d362dc1df4b465da6","observation_id":"d50abe5a-8d1e-41da-a66e-4df0232e8cf2","resolution":{"observed_at":"2026-05-15T20:18:15.666166Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1e890e19-0ed0-466f-bb57-5cabec60bb48","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:b0ae5e974e88335be60eac9f901a692fb84c0c2455028f7272824bcbf27bae4d","observation_id":"b698a4e8-b64d-4f81-ae13-8a1661b32373","resolution":{"observed_at":"2026-05-15T20:18:15.776403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:c854bb88c1ebf71c698653d74ba7eec48570ee7641bd804ebf508d06a1b37f13","observation_id":"52168342-21d1-4b73-8c7e-b36acd46bc7c","resolution":{"observed_at":"2026-05-15T20:18:15.619179Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: CVPR (2017) 3, 7","venue":null,"work_id":"b239760f-8449-40da-99bd-1f1f30e1b116","year":2017},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:9df6e2cd70e62e3964bb68dd7d654418c023ba9f0c29001b71d733f5d76c7c7b","observation_id":"a4b4fa38-fef0-4f95-bd78-9c2c825e419d","resolution":{"observed_at":"2026-05-15T20:18:15.778804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f7aae500-d3ae-4426-a037-fcff8ce4388a","year":1978},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:647bc57c1194ba3e846b4c95ee11107257b1b0ed3e02bc0ef99b95047afb90d0","observation_id":"5a7b5cd3-a7f7-4fac-84c2-11fe68dee4bc","resolution":{"observed_at":"2026-05-15T20:18:15.781036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ACM Trans","venue":null,"work_id":"e7a57db0-1aa3-4857-8b5c-75f8556df462","year":2014},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:67c4180928a6bd7ce0e6133ced5cb67096147121c0a3f656b91877d2fcb9e59c","observation_id":"7254d039-d974-4a4c-bc93-e12cd269cf20","resolution":{"observed_at":"2026-05-15T20:18:15.783620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16410","last_updated":"2023-06-28T17:57:10Z","snapshot_observed_at":"2026-07-06T15:47:57.565746Z","submitted_at":"2023-06-28T17:57:10Z","title":"Towards Language Models That Can See: Computer Vision Through the LENS of Natural Language","version":1},"cited_work":{"arxiv_id":"2306.16410","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.16410","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2306.16410 (2023) 2","venue":null,"work_id":"a1816eeb-528f-424f-af43-2c4b3c993da8","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2306.16410","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:f417ceff084f8b734f32cd0385440184ffc22c0f9819e3fed315686eb79d40a3","observation_id":"b8bad57a-08cb-4d1f-a0c4-6a097a15bc29","resolution":{"observed_at":"2026-05-15T20:18:15.599633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: 1993 (4th) International Conference on Computer Vision","venue":null,"work_id":"f274e751-4884-4ffa-af4d-59f7336e5307","year":1993},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:081ca05a12474da3e742c93413a870eec981bd993af1f35019f424c8ae55b52c","observation_id":"b72a520a-b593-4a50-a263-629843d8af92","resolution":{"observed_at":"2026-05-15T20:18:15.786158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems33, 1877–1901 (2020) 4, 9, 11, 21, 22","venue":null,"work_id":"6923a3aa-0597-4fd8-b652-5ec1288e2553","year":1901},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:7a2165a9dee6980b064f268a6c3d58c56503525f3340da148b997316d5bf5a35","observation_id":"fed26eb1-3b7d-43be-a90e-39e4331dfbbb","resolution":{"observed_at":"2026-05-15T20:18:15.788689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ACM Trans","venue":null,"work_id":"10f72f1a-e4d3-44d2-8393-770848457da2","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:6ef6850b358a7a4316ca25f98705fe796a48cc4fbf8f2c75ce62428d9c573190","observation_id":"a9fe8895-9705-4417-a3fb-5a19979de761","resolution":{"observed_at":"2026-05-15T20:18:15.791003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: CVPR (2021) 4","venue":null,"work_id":"e346c008-0b3b-4a84-a441-0363518b0211","year":2021},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:e005076720cf89dae929b59a0afd3582767fa1d2d90514d301e66fbc6d327b38","observation_id":"2c66a042-f3bd-4b04-9676-7d13b331b5d2","resolution":{"observed_at":"2026-05-15T20:18:15.793107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"76a511be-02ff-4dc9-8fab-0ec9766c9c3e","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:01538a5bf3aa3e7d87c6d4e4b971e84067963f73ce8e7675e0e28050696a7960","observation_id":"ac9a7f0f-0c40-48eb-83fd-5225b857aa86","resolution":{"observed_at":"2026-05-15T20:18:15.795278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":"2310.09478","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-07-08T22:35:40.586981Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","venue":"cs.CV","work_id":"fb62cd1b-3991-40be-a987-3cfa5772b5b5","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:2e8d5aa8debbc73e3c58da8ba369a85ce2061328c0f96bd76424186ea6107a33","observation_id":"996ca3fc-1ad2-4bbe-8cf0-7c41edf64524","resolution":{"observed_at":"2026-05-16T07:13:09.112362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":"2311.12793","doi":"10.48550/arxiv.2311.12793","metadata_source":"pith","pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":"cs.CV","work_id":"90e2b26a-3d27-4567-86b5-929b582a8034","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:37a923b7e888982f2beba1b6d40e997d915e208d948fcc4bae3535aab7b648d0","observation_id":"146fed86-e719-4157-a572-2704ba86e6f1","resolution":{"observed_at":"2026-05-15T20:18:15.593758Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems29 (2016) 3, 7, 8","venue":null,"work_id":"deb5a0f8-7f10-4d04-a3fc-d1e25f1dbd5b","year":2016},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:ea0432d93559e7bb832b2ea913d63767ca434212f835e6746b091118e693ea3f","observation_id":"46b2e885-baad-45ce-85c9-8704c2eed1ce","resolution":{"observed_at":"2026-05-15T20:18:15.798544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"aa0d91ea-d66f-44d2-a659-e0e17e6440a4","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:2c0817b41ccdee819bd5aa1f5147d612eafc4e20ec57d77bfd422e45297b0eab","observation_id":"8cb85d00-298c-49aa-a09e-3e103837ffbe","resolution":{"observed_at":"2026-05-15T20:18:15.800932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7a063330-49ea-428b-b285-d751e07ae81d","year":2022},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:8c8e765f41998d1727e64d7ddd9c7117e62a8a1dbaa8def1fafbe182aae12823","observation_id":"21afd6bf-0673-4a84-9c75-5b750877a0df","resolution":{"observed_at":"2026-05-15T20:18:15.803360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://github.com/open-compass/opencompass (2023) 11","venue":null,"work_id":"dfd9e3bd-325b-4224-a678-7e12f55ccb1d","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:63c4aa2012abf69d78fa1726432aadf288d7288accd6d74e8a855e5fae5f4b8e","observation_id":"998556e5-a872-49a4-9278-fa654d61a263","resolution":{"observed_at":"2026-05-15T20:18:15.805845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"com/InternLM/xtuner (2023) 11, 12, 23, 24","venue":null,"work_id":"1e6d0921-aa78-459c-88b1-6671f43923d2","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:6ef64dbb06378fd1cd1618ad4b5f6c886f199ff24f1b48e362c4cb3b34e0835e","observation_id":"0d8d7a4d-c62a-491b-9f6b-a5d314d42318","resolution":{"observed_at":"2026-05-15T20:18:15.808247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4129bbb6-bee0-4853-a2f4-9c0336561739","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:1f2925dec9350647d8d10e1820bc33775ee5cbe846caf953e1f6283d2e7ebb70","observation_id":"267c7f17-6c3d-449f-9439-fc0dd8361675","resolution":{"observed_at":"2026-05-15T20:18:15.810690Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2b2d8f95-377c-4917-96dc-4c3ae8cb19c0","year":1961},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:7d85ea62f83c11e5eb2f697b8b5b57311f698cc5fd923da4c9ec3d34d8528071","observation_id":"b890ceed-b7cc-4a19-999e-3d6fd1dc3926","resolution":{"observed_at":"2026-05-15T20:18:15.813663Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":"2401.16420","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-07-04T19:50:11.273770Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","venue":"cs.CV","work_id":"93411487-d575-4b44-9d9e-2374874a66bd","year":2024},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:67785f916e897ae7adf821ef717d0da60d2e9e89d2a7746ab05a53f97e136b59","observation_id":"d4b6a04b-d8b2-46a4-8867-e734fd207a15","resolution":{"observed_at":"2026-05-17T05:30:28.063870Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"868760f5-cca5-442f-82f7-24cdb65fdf9f","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:b0c45c462dd3f75cd1a7cfe1bcdace52d106a6feb9035805f1d1439e9c476e2a","observation_id":"c210f13f-37f6-4e5f-abb1-8a52e32644d6","resolution":{"observed_at":"2026-05-15T20:18:15.816068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:987d899fb7244f28d6c706bad4f8629c9fd05e93da88d29dc9529632b9d43788","observation_id":"881999c7-fa79-45d0-b917-f348e6369c1d","resolution":{"observed_at":"2026-05-15T20:18:15.509047Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7426fcc9-728c-4548-94b3-8066bfcdf3d0","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:d240b2c83e719c29b7402115da809adf18dfc6eb00d9b5235b856524724580f7","observation_id":"5001d30e-24ca-480d-828c-8cacd8c79a23","resolution":{"observed_at":"2026-05-15T20:18:15.818380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T12:43:25.257063Z","title":"In: Findings of the Association for Computational Linguistics: ACL 2023","venue":null,"work_id":"293634fd-0d50-4eda-81f1-e3f942865218","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:611b13f60ab49f580e8006d950ef59aff5283fe3043be1c694214ca27d19a093","observation_id":"5d08287a-8053-4e97-8d0d-dfe69ce9caae","resolution":{"observed_at":"2026-05-15T20:18:15.490957Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:29:59.328028Z","title":"37 Wenyue Hua, Lizhou Fan, Lingyao Li, Kai Mei, Jianchao Ji, Yingqiang Ge, Libby Hemphill, and Yongfeng Zhang","venue":null,"work_id":"ed940a1a-3e19-4658-88d1-34194ac465ee","year":2022},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:27147263787ef28d7ab092faf6b480c170919fe5d2da727a941844c72a1ca837","observation_id":"5a80d92d-f532-42ca-83d1-312f60f4cf4d","resolution":{"observed_at":"2026-05-15T20:18:15.485601Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T02:08:06.032511+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T02:08:06.032511+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14882","last_updated":"2024-04-13T17:13:55Z","snapshot_observed_at":"2026-07-06T15:32:22.277926Z","submitted_at":"2023-05-24T08:33:15Z","title":"Dynamic Clue Bottlenecks: Towards Interpretable-by-Design Visual Question Answering","version":2},"cited_work":{"arxiv_id":"2305.14882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14882","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2305.14882 (2023) 4","venue":null,"work_id":"83e3a525-ac09-49bc-8f47-42c8ea0dcf94","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2305.14882","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:7ec3309eceecc31e3af117fe72659a92ca241ec03c82c8da9b6b705a9f62ebd6","observation_id":"95663a59-111c-4a1c-9e73-ba265c6dcc19","resolution":{"observed_at":"2026-05-15T20:18:15.582600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Conference on Computer Vision and Pattern Recognition (CVPR) (2017) 4","venue":null,"work_id":"6f9bf990-253a-4f3b-b775-9b828754544c","year":2017},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:5fe4c8b2f4113cf1ac651e48a12a6f440be3bd08fbd31f328ab751c631396196","observation_id":"d7c261a0-478f-475b-b63f-e59ab1eb3003","resolution":{"observed_at":"2026-05-15T20:18:15.821099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9f04fa08-58be-466f-9ec8-99275c852d40","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:e2e7a24944283638107947ea8cdcd77e4807678816cde7a79e883b0a46dadd4e","observation_id":"2d3701d7-a80e-4cd3-a109-1f6dd3636a23","resolution":{"observed_at":"2026-05-15T20:18:15.823656Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"d272981a-9d3b-42d4-90de-85a5c8596068","year":2019},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:2c1f785d69a602f9cac6bd242777e98b9275cd7f5023559a57d593502b2cdf1b","observation_id":"9cdd2190-f815-4841-9bcf-ced8e62c9fe2","resolution":{"observed_at":"2026-05-15T20:18:15.825953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Alvey vision conference","venue":null,"work_id":"d3ca0b87-55e8-4b5c-9cc8-af5420d7acdf","year":1988},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:7bbe1a760ab40f60ed7021b508550830553334404f1dc3129945f53f619fdba8","observation_id":"0bfe30f8-de75-4de1-a072-3d0165bfd8df","resolution":{"observed_at":"2026-05-15T20:18:15.828507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cambridge university press (2003) 2","venue":null,"work_id":"ccc4ba33-ac29-4759-969e-4eb1aac8d5e2","year":2003},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:52722921b6b44ac20cef0888f6987417e0d46764e291584e9c265b5f73e462c8","observation_id":"a030bb59-3043-41cb-89f5-d0b525733949","resolution":{"observed_at":"2026-05-15T20:18:15.831015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09699","last_updated":"2023-08-17T21:43:24Z","snapshot_observed_at":"2026-08-05T17:48:17.937618Z","submitted_at":"2022-11-15T19:07:53Z","title":"PromptCap: Prompt-Guided Task-Aware Image Captioning","version":4},"cited_work":{"arxiv_id":"2211.09699","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.09699","snapshot_observed_at":"2026-07-01T00:35:10.154544Z","title":"A., and Luo, J","venue":null,"work_id":"0b312d17-4e70-4d0d-ae07-c4a07a338426","year":2022},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2211.09699","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:3ef9fa99e146e453621499fa791866967f1ec29e674b051abcc9e04cdf6be17d","observation_id":"9a16ecd1-667b-4023-b391-602484d52b8b","resolution":{"observed_at":"2026-05-15T20:18:15.672292Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11897","last_updated":"2023-08-17T21:45:52Z","snapshot_observed_at":"2026-07-06T15:06:11.896701Z","submitted_at":"2023-03-21T14:41:02Z","title":"TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question Answering","version":3},"cited_work":{"arxiv_id":"2303.11897","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.11897","snapshot_observed_at":"2026-07-02T14:57:03.744199Z","title":"Alon Jacovi and Yoav Goldberg","venue":null,"work_id":"ade0051f-b36b-47a8-bacd-8151eb9d4b37","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2303.11897","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:d588f73829a5a2391bf1f13d543e2534da2997edde02133836180bb22e6af0e6","observation_id":"532dd131-098b-434e-a28d-6f80c7074153","resolution":{"observed_at":"2026-05-15T20:18:15.689615Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03052","last_updated":"2024-04-05T04:33:23Z","snapshot_observed_at":"2026-07-06T16:57:26.338676Z","submitted_at":"2023-12-05T18:58:37Z","title":"Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2312.03052","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.03052","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual program distillation: Distilling tools and programmatic reasoning into vision-language models","venue":null,"work_id":"b36728bd-6d30-446f-b4b7-930142ea5a3e","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2312.03052","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:50b268dd4f295d23dfc2d3c799ce92fde6d22b2f745d1b437479ede7a271f6c7","observation_id":"3b0a7b7e-1c97-493d-b1ad-5a7ae2346f39","resolution":{"observed_at":"2026-05-15T20:18:15.496968Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International journal of computer vision123, 32–73 (2017) 3, 4","venue":null,"work_id":"612bf119-3459-473a-9f68-d3d269c62f11","year":2017},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:e4204c168fbf46d9a8728cd3d5f48b7ac518eef21d2902a39ef6a4641a2a965c","observation_id":"0b5a1051-327b-4ebf-8c93-0762dfdced0b","resolution":{"observed_at":"2026-05-15T20:18:15.833614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"2d767d7a-ed65-4cf8-b162-b1bc9df944fa","year":2021},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:8e5e1d2d9419fa787686ffda809ebd17e014f5eb14c3407bb1050288293a655c","observation_id":"7e6c7465-7eff-4c68-ae11-60ebfed00596","resolution":{"observed_at":"2026-05-15T20:18:15.836030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17092","last_updated":"2023-11-28T05:53:55Z","snapshot_observed_at":"2026-07-06T16:53:58.875152Z","submitted_at":"2023-11-28T05:53:55Z","title":"SEED-Bench-2: Benchmarking Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17092","doi":"10.48550/arxiv.2311.17092","metadata_source":"pith","pith_arxiv_id":"2311.17092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-bench-2: Benchmarking multimodal large language models","venue":"cs.CV","work_id":"ba82c4a5-9f56-425b-b1dd-5a9fb940b10b","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2311.17092","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:53edc9f8bb95e1a4cb776c5504b5a12feea7bdefd6362245c60b0cc98a470fff","observation_id":"1d5c8533-1aa0-446e-9863-d49c8d67f1cb","resolution":{"observed_at":"2026-05-15T20:18:15.530071Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.308959+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.308959+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":"2307.16125","doi":"10.48550/arxiv.2307.16125","metadata_source":"pith","pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","venue":"cs.CL","work_id":"23881ff0-b851-474c-8712-90744cc07a3a","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:0657aa759ed480b07d229d08f3c35271276da42584b0202c8a1310a790dcf27c","observation_id":"68ea6d96-69d5-4450-8375-3014c5517409","resolution":{"observed_at":"2026-05-15T20:18:15.545662Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":"2301.12597","doi":"10.48550/arxiv.2301.12597","metadata_source":"pith","pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":"cs.CV","work_id":"63d03f4d-15f4-4583-8286-913c19f02294","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:8db85e4059ce091208e7a693dee57a4086a5d1e06d1dcacbe31c0c3f0425a8aa","observation_id":"c1412af2-b079-464d-bc52-db91f758aca3","resolution":{"observed_at":"2026-05-15T20:18:15.558098Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Computer Vision– ECCV 2014: 13th European Conference, Zurich, Switzerland, September 6-12, 2014, Proceedings, Part V 13","venue":null,"work_id":"01ab365b-4147-4ce5-8b62-48b14cd0a30a","year":2014},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:509c91f299956013795c7e998129a8358a05b53b303b541fc15e01b53df16a49","observation_id":"a6cadab9-e8d2-42c2-9ed3-29cf7110eab7","resolution":{"observed_at":"2026-05-15T20:18:15.839038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transactions of the Association for Computational Linguistics11, 635–651 (2023) 2, 9, 21","venue":null,"work_id":"9f43da65-261b-46f1-ac23-ac0190ac1b0e","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:c458a29e9b94ca8912194fb1eab866fcc2d19907a9776a975e91964d2ed328db","observation_id":"a2d66600-7c1c-4a2f-9eaf-5685180dfec8","resolution":{"observed_at":"2026-05-15T20:18:15.841877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"47456a68-eb6b-4971-bef0-dedbee0f86a6","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:210b022ea57839978977daee8f15c1dc18a83e745abbc35c92c21351cc4131da","observation_id":"2da219b6-9c93-4953-8dcc-6bc7fbcd1f54","resolution":{"observed_at":"2026-05-15T20:18:15.844279Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2b412bd3-113c-426f-a47f-ba12f07b8efe","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:98a5402f3e48919a0f7cdeac38eb168e9629535f10c1f421dd8d8807ee354946","observation_id":"14f5665c-0157-4308-98c8-275c83c14c88","resolution":{"observed_at":"2026-05-15T20:18:15.846689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"io/blog/2024-01-30-llava-next/ 2, 4, 8, 11, 12, 23, 24","venue":null,"work_id":"03433b27-f8d5-4394-be46-bca63d431c0e","year":2024},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:e152dfbcff6226310ba34dcbc38586406d6279a864cabc2cbd3a7c0f21d30890","observation_id":"509e345e-cd95-4443-b391-bee8bc86f682","resolution":{"observed_at":"2026-05-15T20:18:15.849407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems36 (2024) 2, 11","venue":null,"work_id":"7caf1a9c-c55c-417d-8745-7898faf2b91c","year":2024},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:f2db818940427d90251ee46e3e420b9500d86f259dbf5651dad4720b8577122b","observation_id":"1dd3f07d-6473-444b-97a2-667afbffde6c","resolution":{"observed_at":"2026-05-15T20:18:15.693679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f977c217-c651-4f75-8c9f-744023d4d871","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:9a9b2bad288427a7f6b37ce593084bce778aea20bde1bc057f2cf552e755c05f","observation_id":"cf854146-2f12-47d1-acae-ff5f845c4577","resolution":{"observed_at":"2026-05-15T20:18:15.697244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":"2305.07895","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-07-01T22:26:17.944984Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","venue":"cs.CV","work_id":"521163e9-4c77-4c73-8b7f-9a6aa75b6d3b","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:80cd8d03019353c3badf8ebd1e01db61bfe4aa74708aaef5d479a89dfd0a78ea","observation_id":"84113f97-4b89-46be-8fbb-382d41d8eb83","resolution":{"observed_at":"2026-05-17T09:55:36.035986Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1cc95002-a477-47dd-9768-8047668e47f3","year":2024},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:aa1caf341a8d65226ec02b0e697b3a1a7d170760075c29cc834c0f4327602e02","observation_id":"434afe2a-894c-47b0-ab3b-eaacd2eeb993","resolution":{"observed_at":"2026-05-15T20:18:15.700983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the seventh IEEE international conference on computer vision","venue":null,"work_id":"7b5c632b-5f89-4bf9-bc5a-586b882f101b","year":1999},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:c9171ecec4ac9778153afe1c10287eb0d6d548deb40034a99213ee8aabaadc70","observation_id":"a66033a4-545f-455c-9f27-947c3b512e4d","resolution":{"observed_at":"2026-05-15T20:18:15.704616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17172","last_updated":"2023-12-28T17:57:06Z","snapshot_observed_at":"2026-08-01T22:57:31.468506Z","submitted_at":"2023-12-28T17:57:06Z","title":"Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Action","version":1},"cited_work":{"arxiv_id":"2312.17172","doi":"10.48550/arxiv.2312.17172","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.17172","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision, language, audio, and action","venue":"arXiv (Cornell University)","work_id":"dee0bd36-ce7b-427c-9af3-0ea894c01777","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2312.17172","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:f5a95078655bbc57e912e610deda788d22c05d81f12f0001f5ce4b3fd24e17e4","observation_id":"7673fcf4-7502-4ced-8300-5b3a687e1033","resolution":{"observed_at":"2026-05-15T20:18:15.684545Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:d13967fd1d2141bc68e790317988e24ced731674cbe0d4b0b4205859c0021ba1","observation_id":"827638ea-6485-465e-b8cb-f6601dc6fd4e","resolution":{"observed_at":"2026-05-15T20:18:15.678753Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MIT press (2010) 2","venue":null,"work_id":"897892df-d7ef-4a57-9365-86c87f2ae046","year":2010},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:c58d8fc349193eead020cef84c62441e3afc6b2c3426652cfc644d2c65f45560","observation_id":"cc83e521-21b9-41d8-9c3e-aa999faf7126","resolution":{"observed_at":"2026-05-15T20:18:15.709099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Science 194(4262), 283–287 (1976) 2","venue":null,"work_id":"a5c91a1e-2598-42b1-b30c-51f91d9c8db8","year":1976},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:12f940b4f5b07350905c592c0330201a4c529b9e048fc7968a277c88e001a113","observation_id":"0eeac0e1-ac71-45ef-9a00-80fac5c18bb4","resolution":{"observed_at":"2026-05-15T20:18:15.713373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10543","last_updated":"2019-08-28T04:16:52Z","snapshot_observed_at":"2026-08-04T12:35:10.027979Z","submitted_at":"2019-08-28T04:16:52Z","title":"SPair-71k: A Large-scale Benchmark for Semantic Correspondence","version":1},"cited_work":{"arxiv_id":"1908.10543","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.10543","snapshot_observed_at":"2026-07-04T13:49:51.655649Z","title":"Spair-71k: A large-scale benchmark for semantic correspon- dence","venue":null,"work_id":"5204ff4e-af27-47db-8f90-6af4daf72cf3","year":1908},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/1908.10543","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:da960f2e5f1d7eb281f83da07bece4574f866cb7a978b7eb12dc17cd11f60188","observation_id":"f49f3f48-d0ac-4389-8315-31b5ccd71c56","resolution":{"observed_at":"2026-05-15T20:18:15.503362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cambridge tiass., HIT479(480), 104 (1969) 2","venue":null,"work_id":"34131340-9fe8-473b-af19-67432ce2e1dc","year":1969},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:5d3357b742c54992da1e35b135fddb342f420b55070caf4fe4117efd1be84883","observation_id":"bfb6c897-1a2e-4c19-be5e-fd2aee2e9fd9","resolution":{"observed_at":"2026-05-15T20:18:15.717033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"52df6c29-4fb9-4b6a-90dc-05d788dc69fd","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:b393de432f7252be99528f10d40fecb6139715680c16da5afec993d1827caeba","observation_id":"1ed26a87-e17c-4207-8559-e3d004ac42b5","resolution":{"observed_at":"2026-05-15T20:18:15.720719Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2307.01952","doi":"10.48500/arxiv.2307.01952","metadata_source":"pith","pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"8034c587-fba6-4941-87ba-c98f2ac962cb","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:7b33365565161ffa65343b3cdb80e3eb4519d448f22dc8fb99edc5dbf75045ae","observation_id":"f91b33e7-a376-4ba9-ac0e-49845d32d7ce","resolution":{"observed_at":"2026-05-15T20:18:15.522936Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: International conference on machine learning","venue":null,"work_id":"a79fd2ed-bea4-4ae4-9910-a78357dee109","year":2021},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:88b2d68b29ab8ab9cb400a32104454c20adc2d4499f4835b4f85b1eb552ea549","observation_id":"7ff96374-5266-4210-a5a0-706d7dcf6277","resolution":{"observed_at":"2026-05-15T20:18:15.724244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":"2111.02114","doi":"10.48550/arxiv.2111.02114","metadata_source":"pith","pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","venue":"cs.CV","work_id":"fbf16034-512e-4dd9-a0bd-7ddd23f532a6","year":2021},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:f927aa15e4cfb67f909543728061ddab5f56071dc4f84d920c6646e272946c95","observation_id":"410795db-2cbf-4622-a1a2-34c8ce65d5ff","resolution":{"observed_at":"2026-05-15T20:18:15.537757Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":"f69a68f5-6b6a-4aa4-ab9a-7b8b0dfcdc0c","year":2022},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:4d29735253649579e91f2019a79ede39a51c2eafcc9a80662d8b4d58828fc041","observation_id":"33c1b918-6657-4f1a-8e24-48fcad2e8f2f","resolution":{"observed_at":"2026-05-15T20:18:15.728266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06712","last_updated":"2023-08-18T05:49:47Z","snapshot_observed_at":"2026-07-06T15:15:26.125395Z","submitted_at":"2023-04-13T17:58:08Z","title":"What does CLIP know about a red circle? Visual prompt engineering for VLMs","version":2},"cited_work":{"arxiv_id":"2304.06712","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.06712","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2304.06712 (2023) 3","venue":null,"work_id":"7cecc1dc-5be8-4d35-b542-1c3c3d23c8c9","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2304.06712","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:b9a4e0495e2ab4e7751dcaeee6c463c854472d71081435e897de396daaeb58ce","observation_id":"dcb66970-d321-4245-98b2-a09e0c80b1e4","resolution":{"observed_at":"2026-05-15T20:18:15.551709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CVPR (2021) 14","venue":null,"work_id":"d2680677-af7f-4d15-9cdb-f20309eaa6cb","year":2021},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:e8668dff49b8356ac3327f97c7c0350ce238b23e22a3fcc10f3d96bf70eb3459","observation_id":"5eb3dfad-7ab7-465a-ac49-c3ca3ec61d1f","resolution":{"observed_at":"2026-05-15T20:18:15.731452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:440afdcfd884fce3feb02ae72c8dc09c53bf8ecb1233d33684c793923413a5c0","observation_id":"b8d17ed1-6576-4d50-ad15-e05a10d25bd1","resolution":{"observed_at":"2026-05-15T20:18:15.564212Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03881","last_updated":"2023-12-06T17:58:25Z","snapshot_observed_at":"2026-07-06T15:39:22.864048Z","submitted_at":"2023-06-06T17:33:19Z","title":"Emergent Correspondence from Image Diffusion","version":2},"cited_work":{"arxiv_id":"2306.03881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03881","snapshot_observed_at":"2026-06-29T17:53:46.724253Z","title":"arXiv preprint arXiv:2306.03881 (2023) 14","venue":null,"work_id":"3ddf23f7-c2db-45ab-be94-4b6db6976b52","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2306.03881","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:7db9a511e7a3122631a5b961b5085f642fd7382e846f42aad6dc4d34d7478899","observation_id":"b4aef595-17b8-4569-bcd5-562b37ff4ffe","resolution":{"observed_at":"2026-05-15T20:18:15.570881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:1f9075ca400f619a5127cb37c9c2c07f1fe195da9b652f5388fdf69ed684e9bc","observation_id":"c17df47c-94db-4fdc-82ff-2839578afde7","resolution":{"observed_at":"2026-05-15T20:18:15.576419Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://github.com/InternLM/InternLM (2023) 12, 23, 24","venue":null,"work_id":"ad603e12-9f0c-46ac-9e00-9f92346a05f3","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:87ddeb1213fcb4baf8e92a2a186b5e8f65a455c20166a52589687fd8c8d21f5f","observation_id":"a7075c6b-8591-482f-83b5-e0ec6c073911","resolution":{"observed_at":"2026-05-15T20:18:15.734581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c5355fd7-0da5-4a4e-a341-7eeeb8f307b1","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:400633e99e7a68b1a12cac0624d9de22e92f5297eed44f59f475f1c88566fa2d","observation_id":"f4cae9cd-991d-4d5b-901a-c596728f644a","resolution":{"observed_at":"2026-05-15T20:18:15.737730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IEEE Transactions on pattern analysis and machine intelligence24(9), 1226–1238 (2002) 2 20 Fu et al","venue":null,"work_id":"be6d062a-8987-4464-8f95-c71f4ad16137","year":2002},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:15b03ad814fc7f9c6c88955819daa338fd5be242da6a9714f29809ca566d81d4","observation_id":"2a3aae24-6ba9-4f12-96a2-661cbac603c4","resolution":{"observed_at":"2026-05-15T20:18:15.740549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:2d2f5adfca2ea79b8d78215cb1527b522ae9dc9232a260876cb8b4d56b382e69","observation_id":"c06fee5a-2d65-4152-a868-6783f875cfff","resolution":{"observed_at":"2026-05-15T20:18:15.588230Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Pro- ceedings of IEEE Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"e6b5056c-9225-4a93-b0c0-6b05a159494c","year":1993},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:60649b909d17a391b2133c9960795ad3b507ac111d8ce7aa742052f54965eff7","observation_id":"56a1c8a3-f519-442d-a6bb-eb1cd0f04b5a","resolution":{"observed_at":"2026-05-15T20:18:15.743471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9d3dc186-bbc1-44be-be77-7ca660b78fc6","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:68b7b12dcabea17499fd64f5fdc691656a2d0534fb5a8c827228ed8b181de538","observation_id":"96aa267c-ca6c-47f5-8249-15ff9908c10e","resolution":{"observed_at":"2026-05-15T20:18:15.745998Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:ab09dc9cea860825ac9cf4ee94b03385690ba2325d50f84ce42a0fb63868197b","observation_id":"21050174-c0c5-400c-b14a-73891c3f4531","resolution":{"observed_at":"2026-05-15T20:18:15.606264Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09295","last_updated":"2023-03-16T13:15:03Z","snapshot_observed_at":"2026-07-06T15:04:11.708950Z","submitted_at":"2023-03-16T13:15:03Z","title":"DIRE for Diffusion-Generated Image Detection","version":1},"cited_work":{"arxiv_id":"2303.09295","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09295","snapshot_observed_at":"2026-07-08T12:04:50.450995Z","title":"Dire for diffusion-generated image detection","venue":"cs.CV","work_id":"a594f9df-0c1b-4e90-a50f-2720024eebda","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2303.09295","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:c702930d62f372c574625710d09b2cc7118cd50ae43b2af6c05eb2a7e6231346","observation_id":"8a04abfe-161d-49f3-96c3-2728f4fad943","resolution":{"observed_at":"2026-05-15T20:18:15.612995Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"70d6766c-fcbb-458e-b6a1-0094ba7c485c","year":2022},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:9bd2c50994c231d376fb4f693e54c8c34eda966f69645813aaa7089dfbe14bad","observation_id":"fc6a34db-744a-4677-a780-d0a488b920e3","resolution":{"observed_at":"2026-05-15T20:18:15.748558Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16375","last_updated":"2025-01-20T00:29:19Z","snapshot_observed_at":"2026-07-06T18:05:20.955471Z","submitted_at":"2024-04-25T07:29:17Z","title":"List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2404.16375","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16375","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"List items one by one: A new data source and learning paradigm for multimodal llms","venue":null,"work_id":"c46195f3-aa14-4c81-b51f-eee76883e98b","year":2024},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2404.16375","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:9b2f61833bcd01bd9bb511abe0da4647d1ab524e42ea124789d0928c78e86028","observation_id":"3be8907e-eadd-4f79-ab9f-c308f9a3827c","resolution":{"observed_at":"2026-05-15T20:18:15.625753Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":"2310.11441","doi":"10.48550/arxiv.2310.11441","metadata_source":"pith","pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","venue":"cs.CV","work_id":"ddc8878e-ed0c-4a66-952a-254dce1c622a","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:6f0c50eb69d213e9f20dff82428ebba8e9fc127fd4315128af587814ee21d837","observation_id":"f3fee5fc-46c8-4076-b40f-91e0f1a6489a","resolution":{"observed_at":"2026-05-15T20:18:15.632677Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: CVPR (2024) 14","venue":null,"work_id":"c4472695-5f93-4e93-803a-0dc09bbd2a73","year":2024},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:0a7ac410f1e33f28362c8f5269c02987ecb7e6da5cf22c93bc3bc57464566b1e","observation_id":"7fced311-c5dd-45cc-9e03-b3a3fb4f3f82","resolution":{"observed_at":"2026-05-15T20:18:15.751646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":"75c0eb7b-f54f-4f8f-8e62-88191b053510","year":2022},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:fdc457cf4acb046cccfe9c633384f847d274d59f63e5fc68431e664297ffb741","observation_id":"e8d55ce6-fd0d-41eb-80e4-30352dbd407a","resolution":{"observed_at":"2026-05-15T20:18:15.754381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":"2309.17421","doi":"10.48550/arxiv.2309.17421","metadata_source":"pith","pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","venue":"cs.CV","work_id":"344e9dbe-1d9b-4992-a4f1-9bc649978f46","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:68cd5434e44f504b8a0f0b1a57ca7e59b6a8916fbca3054f09096f62f246bb89","observation_id":"84fa579c-1abd-48d2-b560-b96da5f3a348","resolution":{"observed_at":"2026-05-15T23:26:07.065720Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-07-06T16:02:39.154387Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":"2308.02490","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-07-10T09:37:00.827227Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","venue":"cs.AI","work_id":"7f3bac41-a0a5-4a7a-bfd2-526b616db745","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:eb8ef1e6b3f491fe0a7185a00d323d245e9b04400438d06aa85a41e5d7b39b9a","observation_id":"8daddfca-2328-4e99-867c-dfe394bb0e23","resolution":{"observed_at":"2026-05-15T20:18:15.655809Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":"2311.16502","doi":"10.48550/arxiv.2311.16502","metadata_source":"pith","pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","venue":"cs.CL","work_id":"da087b16-ea05-4064-980e-ce1d6e281d49","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:f1c3d6771b2a75f919d77d12b1bf7d33c4a41f59ef06988574af7d2e6bbd7f83","observation_id":"566ba0cc-e3c3-4f53-9bf6-6bb74f6bc283","resolution":{"observed_at":"2026-05-15T20:18:15.661112Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems35, 27469–27483 (2022) 3, 9","venue":null,"work_id":"e2210a94-fba8-4f88-a92f-17e6580261d2","year":2022},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:6792a93c2eba0784bfcfd687b60c3d595495a7ce4dada5758745c65535cc60af","observation_id":"d8059fec-5cab-4dab-b8b9-1830dc7cbd2b","resolution":{"observed_at":"2026-05-15T20:18:15.757131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: The IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (June 2019) 4","venue":null,"work_id":"98323bd4-ba2e-40fd-9f20-2fb087c6dd18","year":2019},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:7973770f7c1a13f0023610ce68bef76db724d2a8cabc7204732e6a33a3ba7556","observation_id":"fa975452-116c-4d8e-860a-9083bc9de309","resolution":{"observed_at":"2026-05-15T20:18:15.759785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"You are an AI assistant who will help me to match an answer with several options of a single-choice question","venue":null,"work_id":"b187d5e2-1df8-482c-bf51-59ef60bdcc48","year":2024},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:cd737dad619145d2f8da091841d509b9b12fab1cfa6999bf3c74b34c6616c3b3","observation_id":"f777c19d-b5ac-4ae3-8fec-a230e670e8f9","resolution":{"observed_at":"2026-05-15T20:18:15.765110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":1,"metadata_mismatch":29,"parse_uncertain":0,"unresolved":18,"verified_exact":4,"verified_fuzzy":38},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 63 inbound Pith citation observations for arXiv:2404.12390."}