{"as_of":"2026-08-18T20:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0fd99bc03e89824bc92ba6dfe6201b1caf879e654b982afdc5f416cbc358ede1","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:44:42.681512Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T19:59:19.379119Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T10:06:03.287917Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"cited_work":{"arxiv_id":"2507.04741","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04741","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlms can’t see the obvi- ous: Benchmarking visual understanding in vision-language models","venue":null,"work_id":"c6d835f9-9145-4843-b2fb-ea55e93c2612","year":2025},"citing_paper":{"arxiv_id":"2604.04500","last_updated":"2026-04-06T07:51:59Z","snapshot_observed_at":"2026-08-13T02:16:47.977396Z","submitted_at":"2026-04-06T07:51:59Z","title":"Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T19:59:19.379119Z"},"links":{"cited_paper":"/paper/2507.04741","citing_paper":"/paper/2604.04500"},"observation_digest":"sha256:8da977323dc91762f4b4ef40a4e3811e66b373f7e9719187b2fd9d62ab166323","observation_id":"f6045e2f-5afe-426b-82fb-a8aead0e969b","resolution":{"observed_at":"2026-05-10T22:20:47.936124Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"cited_work":{"arxiv_id":"2507.04741","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04741","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlms can’t see the obvi- ous: Benchmarking visual understanding in vision-language models","venue":null,"work_id":"c6d835f9-9145-4843-b2fb-ea55e93c2612","year":2025},"citing_paper":{"arxiv_id":"2604.10039","last_updated":"2026-04-11T05:23:19Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T05:23:19Z","title":"Counting to Four is still a Chore for VLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:06.327888Z"},"links":{"cited_paper":"/paper/2507.04741","citing_paper":"/paper/2604.10039"},"observation_digest":"sha256:a7bbe8e05c5ce8f7e5e1c808cf1cff32fc30078adc60a6937853d2969d959fcb","observation_id":"c44bf1c6-25b3-4166-9b95-036afa91f29a","resolution":{"observed_at":"2026-05-11T10:06:03.291857Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04741/citation-record","integrity":"/paper/2507.04741/integrity","json":"/paper/2507.04741/citation-record.json","paper":"/paper/2507.04741"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T19:44:37.709893Z","title":"Phi-3 technical re- port: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:37.709893Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:84eeb27ccf6a902ced74ae385eb628be42436fdcf68c2d71111ad5930f32542f","observation_id":"cd12751b-47ca-4096-a191-89bda0a7648c","resolution":{"observed_at":"2026-08-06T19:44:37.709893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T19:44:37.742263Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:37.742263Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:cb8a0f1a8715bfbb00c617379c828e2a9dc5f00817fc115b4ec8dbfd92d18b1c","observation_id":"14030453-a82d-4e78-8056-cc33a3e8e7f4","resolution":{"observed_at":"2026-08-06T19:44:37.742263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:48.860868Z","title":"Nocaps: Novel object captioning at scale","venue":null,"work_id":"31ad5769-a18c-4e71-8315-ae8aafa2610e","year":2019},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:37.818524Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:0f9ddff6cf75a860e983d8d6af06e6cc338ae3e76a68955e9a96e585589ae2ff","observation_id":"c84e1d8b-fd01-4970-8d70-d88fc1c91ee9","resolution":{"observed_at":"2026-08-06T19:44:48.926655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:48.726432Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"ec29a0e0-bc54-42a1-964e-8912524bbd62","year":2022},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:37.873272Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:6e96582ab73d61df6b7588de8bc24c67b4ac04a2de026ad9ff3f88c7c49fc8d3","observation_id":"d9902289-7f7d-4263-81bb-a492e0057036","resolution":{"observed_at":"2026-08-06T19:44:48.787498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:48.529188Z","title":"Claude 3.5 sonnet","venue":null,"work_id":"2a316ffb-c05c-463c-a8af-65f1cddc5a5a","year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:37.942975Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:6c7bee187d976e55cde9b8995eb43f4242021872d8c8ac60f2cfd765b845526b","observation_id":"9245c91e-3f91-4a07-a082-51bfa2d0ad38","resolution":{"observed_at":"2026-08-06T19:44:48.603654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:48.385069Z","title":"Turning visual search time on its head","venue":null,"work_id":"e48ae9de-0973-4235-bc07-ecd7a6b32bf4","year":2012},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:37.996493Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:5d00035789ee2d21da5edde6034e550264c67cb60b3e8e060cdd68cc99146135","observation_id":"01da0eb5-e139-462a-8a73-b0c20fedacac","resolution":{"observed_at":"2026-08-06T19:44:48.460746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-06T19:44:38.051046Z","title":"Paligemma: A versatile 3b vlm for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:38.051046Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:3803e47aa64b67651156f5bb2b910c000a2766767753454fa834801d1ebbf1b9","observation_id":"6e58f10e-1d99-417a-a725-3919fb13421b","resolution":{"observed_at":"2026-08-06T19:44:38.051046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:48.198310Z","title":"Scene text visual question answering","venue":null,"work_id":"4249a5dc-5aec-4d72-824f-91c6ea83eab8","year":2019},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:38.114146Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:a6eb396e35ae8c6393c9f85d73d773749d8e39f41a6505f104417a3b6540d003","observation_id":"85ec1332-0188-49f3-8417-6e2c4ea76d3b","resolution":{"observed_at":"2026-08-06T19:44:48.288258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T19:44:38.169220Z","title":"π 0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:38.169220Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:1fbf5761ba69cd51aefbbce9c7ffbcf5977988fca7b46e7b3a6769ec3e7128ec","observation_id":"acaf3167-99b5-4a3c-9459-617788618ca5","resolution":{"observed_at":"2026-08-06T19:44:38.169220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:48.071699Z","title":"Omni3d: A large benchmark and model for 3d object detection in the wild","venue":null,"work_id":"7bda0e88-095a-4fdb-8de7-c7ba38c8dfe9","year":2023},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:38.230708Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:d8cffcde0d98b244c3f82d9c190455e5ba3fb1787024a55bf6902533d782a691","observation_id":"7f2421e0-e15e-4496-ba4c-52e29bad11e6","resolution":{"observed_at":"2026-08-06T19:44:48.143683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T19:44:38.292602Z","title":"Are we on the right way for evaluating large vision-language mod- els? arXiv preprint arXiv:2403.20330 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:38.292602Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:bced271ca8dd7ef68887914a53c865e980bee4e3e458d5f30ab9691c753360bd","observation_id":"a3e07d3b-54ea-481e-993b-17d919c953f4","resolution":{"observed_at":"2026-08-06T19:44:38.292602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:47.894462Z","title":"Internvl: Scal- ing up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"bfce8114-f7d2-4c57-a135-bb7466b3d5dd","year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:38.347843Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:565b87a29bc2494eaab2b58b790802fb645d7aa87580aa6fc49173c5b07f5db0","observation_id":"66303033-7847-46cf-9af2-7a3889c0c8ff","resolution":{"observed_at":"2026-08-06T19:44:47.983123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-08-18T03:47:41.144311Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-06T19:44:38.410248Z","title":"Nvlm: Open frontier-class multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:38.410248Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:8988d18a14648aa8a8b18fb2142642f835d90f41829aec3d1cbc5b6256933619","observation_id":"b53fa82b-0c77-4ecf-9072-06482e2ac240","resolution":{"observed_at":"2026-08-06T19:44:38.410248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-06T19:44:38.476458Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:38.476458Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:2afe0afe2feec3912f42637d9b8585c14ed7f6850181df6b91e6bce1bd1c4443","observation_id":"7ab4640c-af0a-4d83-bb6a-defc78e4bcb7","resolution":{"observed_at":"2026-08-06T19:44:38.476458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T19:44:38.533337Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:38.533337Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:7e4e3e4fb76c3307b51555612c47c330672ddc9f963c2f73635819c28e23a13d","observation_id":"f8edecab-ee5a-4e73-af10-f8528b260f00","resolution":{"observed_at":"2026-08-06T19:44:38.533337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-06T19:44:38.555170Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:38.555170Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:1f51b9b66a2179f30be17b631157cc188f5346a6e76ef607b8fedb346583ff92","observation_id":"93ac14f5-a627-458c-9e9d-2e6e900a1aa0","resolution":{"observed_at":"2026-08-06T19:44:38.555170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:47.741791Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"cb6dab92-41c4-4c2a-a7eb-b956ee7975a1","year":2017},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:38.683920Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:f86ff1a94b8b71c60ec973379d1f129b651addb22fe6af59a14d39f7c6b3eda4","observation_id":"a852a5ac-b1c6-4c94-abb1-3a3a1798a530","resolution":{"observed_at":"2026-08-06T19:44:47.824009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:47.619414Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":"db8885eb-15ff-4f65-b7f7-c94550b0ede0","year":2018},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:38.820165Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:41b890faff7bf10a3396520393b218aaebc1b8573dcf71cbd034abdd29c55ad4","observation_id":"69e60933-1d29-4596-96be-06efc1af00a7","resolution":{"observed_at":"2026-08-06T19:44:47.666770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:47.443954Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":"e229f4ff-473c-4fda-9517-6c0364a935bb","year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:38.933059Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:7466cebd6473ec3cfe779a6735caf92a6fbbc9e876f3fb147a8a998ef294d4ca","observation_id":"4fd64c2a-609c-4055-9494-2344bed1e8c9","resolution":{"observed_at":"2026-08-06T19:44:47.543544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:39.020480Z","title":"Minicpm: Un- veiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:39.020480Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:0030f29f7aca8bd1fdb5411379a29df7a77f5425ba3603ac5aa975ef12612193","observation_id":"b79a28f9-eb19-423d-8203-96c7161629a1","resolution":{"observed_at":"2026-08-06T19:44:39.020480Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:47.219904Z","title":"Gqa: A new dataset for real-world visual reasoning and com- positional question answering","venue":null,"work_id":"8be8f3db-aa25-4cb9-b1c8-2b869676abce","year":2019},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:39.083159Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:c9d7e61f940e393c76b938fde3e34b3c1d441e631bf963af569aeb9125d2421b","observation_id":"4185bdb5-6312-4327-902f-77d227b6d58a","resolution":{"observed_at":"2026-08-06T19:44:47.320871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:47.062058Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"2e05ccc4-9d78-4be4-993d-bc9400a9b1fe","year":2016},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:39.183198Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:cfb8e2ea51b134328490feff1552b35daa80b3097fedc72a491810bc5193969d","observation_id":"eaf7e95c-5853-4744-88c7-3a63c6dd5ddd","resolution":{"observed_at":"2026-08-06T19:44:47.138713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T19:44:39.353436Z","title":"Openvla: An open-source vision-language- action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:39.353436Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:68e926a94529274c66daf526d31a23237bebfc738c90307d4bfb3004cf56a540","observation_id":"70d38a84-c250-49c0-9dcc-e97c8efaaca8","resolution":{"observed_at":"2026-08-06T19:44:39.353436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.06583","last_updated":"2024-11-12T22:38:32Z","snapshot_observed_at":"2026-08-13T22:43:50.511951Z","submitted_at":"2020-05-13T20:59:53Z","title":"Do Saliency Models Detect Odd-One-Out Targets? New Datasets and Evaluations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.06583","snapshot_observed_at":"2026-08-06T19:44:39.472454Z","title":"Do saliency models detect odd-one- out targets? new datasets and evaluations","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:39.472454Z"},"links":{"cited_paper":"/paper/2005.06583","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:3a58928564550f325c06e45ab881406b1c28b23e98432de37aa5fe5ec4985a41","observation_id":"7baea62f-772e-4f11-8f89-19d417b2316b","resolution":{"observed_at":"2026-08-06T19:44:39.472454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12637","last_updated":"2024-08-22T17:47:24Z","snapshot_observed_at":"2026-08-18T01:32:03.254930Z","submitted_at":"2024-08-22T17:47:24Z","title":"Building and better understanding vision-language models: insights and future directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12637","snapshot_observed_at":"2026-08-06T19:44:39.601722Z","title":"Building and better understanding vision-language models: insights and future direc- tions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:39.601722Z"},"links":{"cited_paper":"/paper/2408.12637","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:90ac6e907a1d5bec5f7eeb42560e3fdc24a4d904e9c1a45a6a3a6310a2059eae","observation_id":"280158b9-84d2-4448-93ab-a08974e26520","resolution":{"observed_at":"2026-08-06T19:44:39.601722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-16T13:55:33.670920Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-06T19:44:39.806355Z","title":"What matters when building vision- language models? arXiv preprint arXiv:2405.02246,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:39.806355Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:1b3120ab6582ff7f864da34651f573689470320adf4e06a9197e1abcc0864d15","observation_id":"fc82e7c1-710b-488b-8e50-98a377738b7c","resolution":{"observed_at":"2026-08-06T19:44:39.806355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:46.893122Z","title":"Seed- bench: Benchmarking multimodal large language models","venue":null,"work_id":"fde62744-ba9f-4e91-a404-01347675ac25","year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:39.925626Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:f685912044cbb5a52a556a1f684b4bc390a83d6a4d4703266081587d97db7086","observation_id":"2c3af3bd-b253-46e6-92b9-a6814b72ecb6","resolution":{"observed_at":"2026-08-06T19:44:46.988909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:46.736100Z","title":"Evaluating ob- ject hallucination in large vision-language models","venue":null,"work_id":"bf3c8298-26a5-43f9-b5f5-331cf9d02d85","year":2023},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:40.048744Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:5b8a801e162d257a39674104ccd4b290bf6a3489cd0ac34714bf457f8744a22a","observation_id":"d36e798a-9e8f-4642-b26c-6f4d23a73377","resolution":{"observed_at":"2026-08-06T19:44:46.839109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:46.544584Z","title":"Vila: On pre- training for visual language models","venue":null,"work_id":"dd228caf-e32a-43c1-bb28-279ac0cbe024","year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:40.212638Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:cb13b6c01508b4b6070aa4c0c06a462cdf11ecc01308a4044b13791662324b3e","observation_id":"b11e4fac-9660-4513-b0f3-dbb799e01229","resolution":{"observed_at":"2026-08-06T19:44:46.627895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:46.348771Z","title":"Microsoft coco: Com- mon objects in context","venue":null,"work_id":"cd60a869-d7aa-4b50-ad7d-501706dad897","year":2014},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:40.319698Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:37945a56624962f0dd3d6956e7d7717bb5a4253a0926ea20d9426eaea5f720ec","observation_id":"0172889d-6d31-4f20-81f1-ba300481fc30","resolution":{"observed_at":"2026-08-06T19:44:46.456530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:46.140409Z","title":"Visual instruction tuning","venue":null,"work_id":"b706dedb-6361-4738-843f-108f11fe6e72","year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:40.458836Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:c215ae156ed23c0818c546db84a2facdb647966db70e73b6e7f5e212c2c7b7b4","observation_id":"cf61eb70-d750-4e9b-88d3-ec67164caa64","resolution":{"observed_at":"2026-08-06T19:44:46.228014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-08-17T03:48:18.599994Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-06T19:44:40.616829Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:40.616829Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:9dc62b2d772195c28ca64b7b97b0ed96a92a4d75af937734d9505ec509ca1c0f","observation_id":"94263374-54bb-438d-8038-f7c4efd109f1","resolution":{"observed_at":"2026-08-06T19:44:40.616829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:45.982511Z","title":"Learn to explain: Multi- modal reasoning via thought chains for science ques- tion answering","venue":null,"work_id":"222d4aba-3c37-4a24-8992-a0c0fa0a0d52","year":2022},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:40.734841Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:5325b3906a1a4e930fa301545330380761b6276e94015b773c9346ebc880be49","observation_id":"99d0bad0-eda6-4edf-9cfc-0bbff6d80ae8","resolution":{"observed_at":"2026-08-06T19:44:46.062014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:45.818619Z","title":"Mathvista: Evaluating math reasoning in visual contexts with gpt- 4v, bard, and other large multimodal models","venue":null,"work_id":"9e50acc2-db2a-4840-82ef-21aa38484ce0","year":2023},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:40.859398Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:650be737874873e1376f2371526fdf514e1a179abc4f04f285dd55eed0239834","observation_id":"8a45a6f8-99c7-4389-8bfd-b67c878aea0e","resolution":{"observed_at":"2026-08-06T19:44:45.903231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-06T19:44:41.014044Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:41.014044Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:7f7bdecd535945aec5373ac6097d768eab55c4489356b134f2d47f57c5cdd5d9","observation_id":"f1d3dbf4-af42-4153-aa0f-aadd4f58b836","resolution":{"observed_at":"2026-08-06T19:44:41.014044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:45.655190Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"c2777224-2d3a-42bb-b63d-9e6272cedd6a","year":2021},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:41.081835Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:94adb873283dea74aa327978e0619eb5935bf10825ddb2edb2a37bca84f24f74","observation_id":"c7d4289e-651b-4e57-8e0c-6df8e3cd5099","resolution":{"observed_at":"2026-08-06T19:44:45.723442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:45.515965Z","title":"Info- graphicvqa","venue":null,"work_id":"838bf48a-d18e-4dee-9492-cd521c850acc","year":2022},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:41.166811Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:4083f81de80d9b591af172ad219b45f9ec16eb606473e79935c4351fbb7bb1de","observation_id":"d07c4494-5902-40ae-9b15-7bc080e31455","resolution":{"observed_at":"2026-08-06T19:44:45.559020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:45.364737Z","title":"Llama 3.2: Revolutionizing edge ai and vi- sion with open, customizable modelsy","venue":null,"work_id":"84a3efef-f486-48b1-ab34-e2396377b676","year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:41.267499Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:52f4bcd4679ec07d0b165ad10e845c04371c455396948789e372edd64cee032a","observation_id":"763fe03c-eabb-4a20-b96d-b791228021e5","resolution":{"observed_at":"2026-08-06T19:44:45.442472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:45.198701Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"ab3ac7d5-b83c-4705-9cfc-681d342718a3","year":2019},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:41.334651Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:7432ba2c508c452444eaa187d1159a42b673506a5d716fdc089afc9082626c18","observation_id":"cdf1c0a9-bec6-4f2f-94d9-7a191168e8a4","resolution":{"observed_at":"2026-08-06T19:44:45.283847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:45.055602Z","title":"Mind children: The future of robot and human intelligence","venue":null,"work_id":"a28482c5-5e2b-4391-b006-a069e02f027e","year":1988},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:41.401301Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:7152f7ebffebbff41caf75778adaff06c418988257b912591f708280c911bfda","observation_id":"77168ac6-96d4-4a6f-b57e-209e8e3f7c67","resolution":{"observed_at":"2026-08-06T19:44:45.147605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07945","last_updated":"2024-02-09T02:33:45Z","snapshot_observed_at":"2026-08-16T14:20:01.793685Z","submitted_at":"2024-02-09T02:33:45Z","title":"ScreenAgent: A Vision Language Model-driven Computer Control Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07945","snapshot_observed_at":"2026-08-06T19:44:41.444033Z","title":"Screenagent: A vision language model-driven com- puter control agent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:41.444033Z"},"links":{"cited_paper":"/paper/2402.07945","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:99456e58065a1580b2e028c14b963f59322914ab6f77855937b414d2b5f18ef1","observation_id":"f9af5b3d-b0b3-4a02-ab56-90d1d4907437","resolution":{"observed_at":"2026-08-06T19:44:41.444033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:44.917326Z","title":null,"venue":null,"work_id":"d12f217b-e68f-4d2e-b284-1d04dfd935f2","year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:41.489524Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:4ce1844c7c843b06dd1afb096e54d5c8984c1906190aca4ea3beeb74eb0a2f6b","observation_id":"cb40e48f-4ad3-404b-a693-273af561f915","resolution":{"observed_at":"2026-08-06T19:44:44.991913Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:44.784631Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"17d52fb3-1d45-45a2-baeb-2430e351e87d","year":2021},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:41.539206Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:fe77b43c32d7223ae9da91e893727dafedf7747ebc7915da14f29abe6f6baa50","observation_id":"30a73b3a-b0c3-4f3f-be7b-5d710f83ddaa","resolution":{"observed_at":"2026-08-06T19:44:44.845666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:44.616704Z","title":"A- okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":"e05a59cc-c27a-4b83-a5f5-74bb5ee4172e","year":2022},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:41.596641Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:752de6eb15f231f2de81a9011d534693032dfe10b9accdd8757e64babfa054f4","observation_id":"53770063-7796-46d4-a93e-6356347c5a43","resolution":{"observed_at":"2026-08-06T19:44:44.699076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:44.509349Z","title":"Towards vqa models that can read","venue":null,"work_id":"a618ddac-ff6d-40d2-89bf-12999019f8b6","year":2019},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:41.649314Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:d1ea654c5e473bf03fe642ab781248e0d94be09cd4fe80638f329a1b8d79ebc7","observation_id":"58ef7527-0c2e-4c45-bc2b-9d75b2604e1e","resolution":{"observed_at":"2026-08-06T19:44:44.559632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:44.399954Z","title":"Internvl2: Better than the best — ex- panding performance boundaries of open-source mul- timodal models with the progressive scaling strat- egy","venue":null,"work_id":"8cb50702-23a9-4e0f-9a8f-e7d8aadf12fa","year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:41.701633Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:9a78b867f85f536fc92e97b7f150ede81d8eda60d8f8ddedd9943552b2dc7100","observation_id":"b7ceb6ce-2ee2-47d9-b46d-23e11e69a6c0","resolution":{"observed_at":"2026-08-06T19:44:44.437364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-15T07:01:36.213052Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-06T19:44:41.746239Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:41.746239Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:22dcb81456b217be390859085e60c0ea680163d558e11dc06ed02a3722240271","observation_id":"7b86b4c5-7926-4b88-a168-55593c6c5e42","resolution":{"observed_at":"2026-08-06T19:44:41.746239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:44.270467Z","title":"Eyes wide shut? ex- ploring the visual shortcomings of multimodal llms","venue":null,"work_id":"01f986a2-b5f2-4cd4-b676-8ce43f01234f","year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:41.796290Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:65e91e28c2c14bf74804b72a5bd3b360aa08335b0dc0af0bd15e11adc8748af1","observation_id":"b467029b-f322-49e9-b0ea-64172cfb66a6","resolution":{"observed_at":"2026-08-06T19:44:44.320333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:44.139211Z","title":"A feature- integration theory of attention","venue":null,"work_id":"71b355eb-224c-4aca-be3a-34bfe3cf3f78","year":1980},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:41.870184Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:6040d29f379d5c46c619f2f2ef05d6d3c708ee49683d0257afd0e0320f568b09","observation_id":"21317282-71bd-4a2f-9b38-e93fbf8e20c9","resolution":{"observed_at":"2026-08-06T19:44:44.202666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:44.016714Z","title":"Measuring mul- timodal mathematical reasoning with math-vision dataset, 2024","venue":null,"work_id":"50b1a9c0-7746-473d-9c34-552111499686","year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:41.933031Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:6c7444b4b0a771bcd10ad0bfbdf6455247c3a94d016d427f8fd35b2413173f6f","observation_id":"8b0563c5-8821-43c4-85a9-cadf84cee1ad","resolution":{"observed_at":"2026-08-06T19:44:44.074777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T19:44:41.992244Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:41.992244Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:155b7afbc2aaf4008dddc8e46da56c88265323e7a62aa80ea90eac28e5e452b5","observation_id":"84e9e85b-4037-4e21-a62f-8039d6d8de67","resolution":{"observed_at":"2026-08-06T19:44:41.992244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:43.903146Z","title":"Five factors that guide attention in visual search","venue":null,"work_id":"667aca39-fe34-442b-b64f-4e2b599f93a7","year":2017},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:42.046127Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:9cf7cc1b8e7cc6a3184a4b9c87890224533d6cd394215984920d709dcfa8e4ba","observation_id":"d9ab4423-8c2b-48e9-81dd-9e660a6bc669","resolution":{"observed_at":"2026-08-06T19:44:43.967292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:43.733791Z","title":"Grok-1.5v","venue":null,"work_id":"79191dc4-2046-4d60-8040-856413a73c74","year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:42.099279Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:4048587439999fe8d42428c0c5a5a07a2a8961d168f6e7131c695f2f3aefeb39","observation_id":"8e1fbd81-329d-4957-8a5a-bcce8c3636e8","resolution":{"observed_at":"2026-08-06T19:44:43.805297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T19:44:42.166888Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:42.166888Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:cca855068cc547dd33ccb1ffe46ba6e1d45d666a4c0155d2593decafdc22cbbe","observation_id":"55856718-6c7f-4364-b869-accb4f33b636","resolution":{"observed_at":"2026-08-06T19:44:42.166888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-18T03:16:44.825874Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-06T19:44:42.219769Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:42.219769Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:35944061feeb71352827916463022776f3e5d4e7f186e5429cb07ed9336e9bc5","observation_id":"6e3da194-c577-4740-b461-eb25861eeb62","resolution":{"observed_at":"2026-08-06T19:44:42.219769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:43.599355Z","title":"Mmmu: A mas- sive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"3033bd68-7064-4ac0-9bd5-5a38982aa244","year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:42.300156Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:044a34cc26def3868d664483563aecc2519084baed908b600e2ce55e33409c28","observation_id":"da020f1b-8afb-4cac-b3a2-f168d68970d8","resolution":{"observed_at":"2026-08-06T19:44:43.649705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:43.447855Z","title":"Mmmu: A mas- sive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"f601799f-b9f2-4553-a4a5-ad9058e3234e","year":2024},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:42.377530Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:9f409c7a0ff54d8a043abafe3f384b562d82a874d7b641a9c531f4fa1f77c4ab","observation_id":"a431cb4e-c191-4aa1-8326-56c07894d270","resolution":{"observed_at":"2026-08-06T19:44:43.503591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:43.325750Z","title":"Sigmoid loss for language im- age pre-training","venue":null,"work_id":"e0817bd1-4c63-43ae-90cc-67bac667e963","year":2023},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:42.440463Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:741226f3e70b79b7169818a625135aeb9026bc1e404f227fff2381f2fa009499","observation_id":"4fbb2be1-551e-4ca5-a347-103e3972404a","resolution":{"observed_at":"2026-08-06T19:44:43.392391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:43.144440Z","title":"Se- mantic understanding of scenes through the ade20k dataset","venue":null,"work_id":"98e83ba9-17f6-4d50-b255-3c4f533996ba","year":2019},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:42.518402Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:78a0729cf6cb9b43c4a1d8b407719291acbae265540d67d6351564679bab23fa","observation_id":"ef59860e-698c-4fba-934e-a74aba7d0f62","resolution":{"observed_at":"2026-08-06T19:44:43.236260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T19:44:42.599032Z","title":"Minigpt-4: Enhancing vision- language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:42.599032Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:b0d13b211f0c166091918dc4dac0ea4d421a0781c4bb6a2c71d5df98c7a80478","observation_id":"680e15e7-5b94-4da6-b8d0-d018b9073a8a","resolution":{"observed_at":"2026-08-06T19:44:42.599032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:43.011513Z","title":"The next most common range is > 25 distractors, with a similar count to the lowest range, reflecting the dataset’s coverage of highly complex scenarios","venue":null,"work_id":"d3b54d74-4780-48ce-89d2-6ca3cdd16a96","year":null},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":600,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:42.681512Z"},"links":{"citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:21a87b09b1d63637f6b354148a339b4b3bb5eb9b48dfe82d9f201d869fd28f84","observation_id":"95e07439-2c88-47c1-a2bd-5328a736e6a6","resolution":{"observed_at":"2026-08-06T19:44:43.079147Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T18:08:52.487764Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 2 inbound Pith citation observations for arXiv:2507.04741."}