{"as_of":"2026-08-19T16:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b7897dbb8bcdc1f018f9cc42771dfe9bb1b339f09382f10e13250b322198d53","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:47:21.298721Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T21:06:09.166363Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T00:39:16.760441Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"cited_work":{"arxiv_id":"2509.25339","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.25339","snapshot_observed_at":"2026-07-04T00:39:16.760441Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","venue":"cs.CV","work_id":"8d02ba85-ccfb-4f4e-9137-1228d113907f","year":2025},"citing_paper":{"arxiv_id":"2606.20736","last_updated":"2026-06-17T15:35:36Z","snapshot_observed_at":"2026-08-15T06:36:17.502591Z","submitted_at":"2026-06-17T15:35:36Z","title":"REKEY: Metadata-Grounded Visual-Key Regeneration for Contamination-Resilient VQA Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T21:06:09.166363Z"},"links":{"cited_paper":"/paper/2509.25339","citing_paper":"/paper/2606.20736"},"observation_digest":"sha256:9db258e9356c56d7c905c93a40eb3d8baa87098341be210e2f3bf2c89f4ca3bd","observation_id":"f2269bc1-a5ce-4470-8187-3f2c773314d1","resolution":{"observed_at":"2026-07-04T00:39:16.762070Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.25339/citation-record","integrity":"/paper/2509.25339/integrity","json":"/paper/2509.25339/citation-record.json","paper":"/paper/2509.25339"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.07356","last_updated":"2016-09-27T19:56:22Z","snapshot_observed_at":"2026-08-14T21:51:26.440888Z","submitted_at":"2016-06-23T16:05:16Z","title":"Analyzing the Behavior of Visual Question Answering Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.07356","snapshot_observed_at":"2026-08-15T15:47:21.040327Z","title":"Analyzing the behavior of visual question answering models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.040327Z"},"links":{"cited_paper":"/paper/1606.07356","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:a4578eee1c32c0a9aca660d488fc576f8fd58192e0bcc6a910f345d065f7e32d","observation_id":"4576053d-b36e-44ee-8d3e-6b87bef647f0","resolution":{"observed_at":"2026-08-15T15:47:21.040327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.417614Z","title":"Don't just assume; look and answer: Overcoming priors for visual question answering","venue":null,"work_id":"c6599479-fe17-449b-b750-9a59654e6b03","year":2018},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.044962Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:ef85e79a19fbe2020aa41d6346bbe977443ac70f22d3ffcfde4098ae88ec1cf4","observation_id":"36fd9518-4c04-4cea-8dd2-b5fa5540390d","resolution":{"observed_at":"2026-08-15T15:47:22.424122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.394592Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"5c4d6185-113b-463a-a388-9eb00b397950","year":2015},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.049331Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:3f71f90c2b8685cdc334f7fbfdb20d5406f0576b0cfacee16cc5f6b47ffb818b","observation_id":"b88778ee-6288-4281-8351-953ba692dc25","resolution":{"observed_at":"2026-08-15T15:47:22.401379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16890","last_updated":"2023-09-04T15:06:15Z","snapshot_observed_at":"2026-08-19T02:52:50.108039Z","submitted_at":"2023-08-31T17:52:04Z","title":"TouchStone: Evaluating Vision-Language Models by Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16890","snapshot_observed_at":"2026-08-15T15:47:21.053486Z","title":"Touchstone: Evaluating vision-language models by language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.053486Z"},"links":{"cited_paper":"/paper/2308.16890","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:9e0d044fcbe21274be949c85b2ef871ed2809d2bfcaba8c459b54fb414ef2fb0","observation_id":"d64e739f-4735-4809-b787-2a826ecbf900","resolution":{"observed_at":"2026-08-15T15:47:21.053486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T15:47:21.058171Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.058171Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:a76f4bb3d858b6f3a8fb119e341fbddc329c64940615f974e303dc9f6b2b3f82","observation_id":"0c0907f8-1167-4777-8fe4-5de53dae2734","resolution":{"observed_at":"2026-08-15T15:47:21.058171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06595","last_updated":"2023-12-26T15:57:47Z","snapshot_observed_at":"2026-08-18T16:51:00.679875Z","submitted_at":"2023-08-12T15:27:51Z","title":"VisIT-Bench: A Benchmark for Vision-Language Instruction Following Inspired by Real-World Use","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06595","snapshot_observed_at":"2026-08-15T15:47:21.063096Z","title":"Visit-bench: A benchmark for vision-language instruction following inspired by real-world use","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.063096Z"},"links":{"cited_paper":"/paper/2308.06595","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:1c125d30dae1fcb4922e5f04402b5338ef384633dcc61501a4e9cc449f19fbb7","observation_id":"9b10dda8-45ad-4bc0-8edf-8be54046ef0e","resolution":{"observed_at":"2026-08-15T15:47:21.063096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-08-16T13:49:00.762109Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-15T15:47:21.067942Z","title":"An introduction to vision-language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.067942Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:4fa0d2dabfb13bc200f266864db29fcc5cd10916ab7b0ac0c9d81cad87528110","observation_id":"4f86f860-a92a-44e7-b326-bebd1325be26","resolution":{"observed_at":"2026-08-15T15:47:21.067942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.375674Z","title":"Rubi: Reducing unimodal biases for visual question answering","venue":null,"work_id":"af790d9b-1988-4c3e-9ca4-b7938cf1f692","year":2019},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.072234Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:6b53529c170e070225e5f1e86c63816739e0fc91454f58a193e51215e0080abb","observation_id":"3ee4b375-35a2-4ed8-951f-e29d1c51bba5","resolution":{"observed_at":"2026-08-15T15:47:22.380876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.360606Z","title":"Frankland, Thomas L","venue":null,"work_id":"7e0878c2-a122-48aa-af1b-6e4f1fb8e5a1","year":2024},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.075941Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:927a225a950452cfa4ceb9f6dc335a6e512ecb0e104765be5d36dcb5f07481f1","observation_id":"eba9351e-66a9-47a2-ad2e-540a1cbf8742","resolution":{"observed_at":"2026-08-15T15:47:22.365038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.343040Z","title":"Are we on the right way for evaluating large vision-language models? Advances in Neural Information Processing Systems, 37: 0 27056--27087, 2024","venue":null,"work_id":"c06bd669-3549-4ca7-9d35-e1445f6e6bc4","year":2024},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.080040Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:e305b516b235ba03cb4102686d475e4760dfc381dab91cf6f72d5044fb14b2a6","observation_id":"5e17b1aa-5508-4161-917a-a22e05ba2199","resolution":{"observed_at":"2026-08-15T15:47:22.348689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.318319Z","title":"Internlm-xcomposer2-4khd: A pioneering large vision-language model handling resolutions from 336 pixels to 4k hd","venue":null,"work_id":"db6a04dd-1150-486d-9f98-0bd7bb565ecb","year":2024},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.084154Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:608b312f791b0d9d18a087b4e6526ade48ab21973e077e1a97e972e62447dc2d","observation_id":"eac2d1b9-92f1-472a-bcbc-4ca0ba736604","resolution":{"observed_at":"2026-08-15T15:47:22.326194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.291731Z","title":"Dense and aligned captions (dac) promote compositional reasoning in vl models","venue":null,"work_id":"5dc710ed-0adb-4dfe-973b-33c0f9357dd3","year":2023},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.088177Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:9815a10da2db8ceccfcba9004bc17f70d5e5cfe4c30f6ff5b4a2133473cac690","observation_id":"b5919fa9-9530-42e9-ae14-9f2d8b8e5407","resolution":{"observed_at":"2026-08-15T15:47:22.298236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.274126Z","title":"Teaching structured vision & language concepts to vision & language models","venue":null,"work_id":"524dc743-695c-44c0-82cb-bea387f7f82e","year":2023},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.092076Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:6577bea96e60a671c7b544228a7fd233acb5ad021927c5742317246ddb6f459e","observation_id":"acea20a7-fd49-4782-8089-bc3a54530cbe","resolution":{"observed_at":"2026-08-15T15:47:22.279557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:21.095843Z","title":"Datasheets for datasets","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.095843Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:1c5c1a66735460b5845fa7fd97606a2fdfa69eda0b009b63ede9893a0231455b","observation_id":"240e69e9-fc52-4a20-909d-48b0a6ede26c","resolution":{"observed_at":"2026-08-15T15:47:21.095843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:21.099947Z","title":"Gemini: A family of highly capable multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.099947Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:6ee3d443c215c6196fe61211bcd184097292aa82f848ef1ed640d8c8317fe5b3","observation_id":"bd2025af-03d4-40ec-a42a-b14a45d18f16","resolution":{"observed_at":"2026-08-15T15:47:21.099947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.244809Z","title":"Gemini 2.0 Flash Model Card , April 2025","venue":null,"work_id":"406da00a-71fb-4321-ac4f-4918e08e9111","year":2025},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.103540Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:b7b6095467e2a44b26d9d4404231c880b5e9e219a734f9a02a7314f64bc08221","observation_id":"c2fa9098-eb69-4e5e-b187-95de0361c95c","resolution":{"observed_at":"2026-08-15T15:47:22.250312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-15T15:47:21.107273Z","title":"Gemma 3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.107273Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:b66922f9c3011e2a782000802dcc650fb9d0c29ad8334ed63077c1150509a150","observation_id":"5e20987b-301c-43fc-ab17-94d3f2ad7b21","resolution":{"observed_at":"2026-08-15T15:47:21.107273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.225082Z","title":"Announcing Gemma 3n preview: powerful, efficient, mobile-first AI , May 2025","venue":null,"work_id":"a2d9fa5a-3191-4af8-85e5-d8617b0a74f5","year":2025},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.111628Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:3a013ad9b43c96599f53efade2d41c86cdd8e0d26e47e420cdb8822bba55c802","observation_id":"6f355e9d-40b0-4cd3-b177-8eea9ed46ac1","resolution":{"observed_at":"2026-08-15T15:47:22.230181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.206314Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"bfae52bf-798d-49c3-a229-79d0d586a81e","year":2017},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.118171Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:1c920f290f57c025b91a04a3df9967f7af4b6f0b86774121c2b8eb173b2849e9","observation_id":"7437e8e0-9bab-47b3-a9c9-376ea8443af4","resolution":{"observed_at":"2026-08-15T15:47:22.213241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.184261Z","title":"Horizon Alpha - Advanced AI Language Model , August 2025","venue":null,"work_id":"74cdd0b2-41e1-4a49-bed5-b581109ca7b0","year":2025},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.122326Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:eb065bdee9ee5e7d8053bc1b052173ead7f996b2f5baaa526e04235fc3deea7b","observation_id":"f577566f-61d2-4934-9b3d-35f29ed3da87","resolution":{"observed_at":"2026-08-15T15:47:22.194800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:21.125964Z","title":"Sugarcrepe: Fixing hackable benchmarks for vision-language compositionality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.125964Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:22c8389be4881cc97f8822c8ab79057ab1a8c61cb14bfeb5c13b778b75aadc00","observation_id":"9f9fe8bf-3b2b-48e9-99bc-53a8a006fad1","resolution":{"observed_at":"2026-08-15T15:47:21.125964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.148438Z","title":"Conme: Rethinking evaluation of compositional reasoning for modern vlms","venue":null,"work_id":"cb9e3a09-eba7-4682-8053-820fb48a1b82","year":2024},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.130094Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:8baabe76e8926cbc966f1f29d9e6d25ca5875690a2db6cf75506f4a3bf52718e","observation_id":"f251e5ee-0697-4eb8-a8c3-24fac17a7b2d","resolution":{"observed_at":"2026-08-15T15:47:22.155519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.130306Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":"207491cc-d7e5-4752-b9f7-1005515f1c3e","year":2022},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.135099Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:815700c3b03978232644bf8846ca8a63215f78f24523719c2caa1e1cb9541788","observation_id":"f6ff9b14-0eab-41b6-a60f-77e3d8b0e79d","resolution":{"observed_at":"2026-08-15T15:47:22.136115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.111552Z","title":"Dvoichnye kody s ispravleniem vypadenii, vstavok i zameshchenii simvolov","venue":null,"work_id":"dcd9180b-ce0b-42cd-81f9-2f042aed21b7","year":1965},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.139304Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:3e56a588e1c44dd78fb1727cf8806397da0ce84adc9f50baee43fee0304bb7a1","observation_id":"a861aeaa-a769-43b1-a18a-347c688b418f","resolution":{"observed_at":"2026-08-15T15:47:22.117058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04219","last_updated":"2023-11-07T18:59:58Z","snapshot_observed_at":"2026-08-16T14:45:10.647424Z","submitted_at":"2023-11-07T18:59:58Z","title":"OtterHD: A High-Resolution Multi-modality Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04219","snapshot_observed_at":"2026-08-15T15:47:21.143108Z","title":"Otterhd: A high-resolution multi-modality model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.143108Z"},"links":{"cited_paper":"/paper/2311.04219","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:e91839cd7996d216d27feb0bd69d5e97a601e309b6229b64d1ec1e800a59cc11","observation_id":"790b2c43-80eb-455f-98d9-5eb7cd5321a3","resolution":{"observed_at":"2026-08-15T15:47:21.143108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-15T15:47:21.147071Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.147071Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:7cdbd6d854b046abf000b7749578237aab5ad41046c5d931df4931cc93c5e421","observation_id":"3eddabbf-1ee2-43b6-8ea9-a3153d23b222","resolution":{"observed_at":"2026-08-15T15:47:21.147071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-15T15:47:21.151496Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.151496Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:3a5ed51a18834373204a6970faf10da75b2d1b512f5fa964c1d5947ef073ca6d","observation_id":"e1035144-e976-4713-ab9f-1a64ad82b23e","resolution":{"observed_at":"2026-08-15T15:47:21.151496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.094660Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"d44386b9-cb16-4e7f-b499-50a6ac786258","year":2023},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.156664Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:3f01ae4ed0240ea4a63e3940166aa302c7d894955c1d32a90ffbc888d35d185d","observation_id":"04f7edbe-9fa1-4a7c-967f-4bed859fc1cc","resolution":{"observed_at":"2026-08-15T15:47:22.099750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:21.160513Z","title":"Omnibench: Towards the future of universal omni-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.160513Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:3e70e8f02ec8f1ec70447026dfd108e873568a9b40db1bbbaa8cf18cd7d6daa2","observation_id":"abe1a6c5-fdbc-4a82-8d77-db8e8afadbe3","resolution":{"observed_at":"2026-08-15T15:47:21.160513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.080525Z","title":"Introducing LFM2: The Fastest On-Device Foundation Models on the Market Liquid AI , August 2025","venue":null,"work_id":"6b291fa7-0d3e-468d-bb5f-d5c34a146936","year":2025},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.164491Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:80e4e96c5db34e4644aed169fed824af3b0474916613f193100c76e02feeabfc","observation_id":"7be46e89-72bb-4df3-beef-1dfb9c7b4398","resolution":{"observed_at":"2026-08-15T15:47:22.085503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-15T15:47:21.169973Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.169973Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:55171dd80d9fdb1230ab6a7181ad953119ef8f0323eb522d3777a0044138f82d","observation_id":"88745ae0-5b33-4b9c-80e3-c104f21a1df4","resolution":{"observed_at":"2026-08-15T15:47:21.169973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.064062Z","title":"Visual instruction tuning","venue":null,"work_id":"eae52528-c603-48d7-9e91-01fef5593786","year":2023},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.174736Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:189a8c8e31dc8b1a928d66028a034e065807ea026968dd14c591a69288d5c9d4","observation_id":"5f1aa9b3-f745-4527-ae8d-3781a72d6564","resolution":{"observed_at":"2026-08-15T15:47:22.068206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:21.178919Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.178919Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:4ec4b16f065bac4fe81e8fd38487ea6692f0ad0c9d68287af8112c8eadf883a1","observation_id":"9131d634-98cb-4b2f-8364-d37164c47830","resolution":{"observed_at":"2026-08-15T15:47:21.178919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.039132Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pp.\\ 216--233","venue":null,"work_id":"5cb5c78b-3440-4ff5-b180-95ba26232876","year":2024},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.182824Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:c03bb7f34f3ef189c461be7a082244582b6354bc812a68a136b10fc4a8477a9c","observation_id":"e4702157-2270-4dc0-9fcb-6d4f0173892a","resolution":{"observed_at":"2026-08-15T15:47:22.043783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-08-15T15:47:21.186700Z","title":"Smolvlm: Redefining small and efficient multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.186700Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:354c81ebcb7d71e3902f8b531e933cdde71d98e988c325cd70e0079b5d1e4629","observation_id":"88151aa5-fe11-456a-a41f-07f3871f88af","resolution":{"observed_at":"2026-08-15T15:47:21.186700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:21.191082Z","title":"Umap: Uniform manifold approximation and projection","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.191082Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:714ccc90b39a6f74b805c4ba92dd4905d513bc7eee339f259217c247add1c1cd","observation_id":"c014dd17-f679-4637-b26c-a042e91c0753","resolution":{"observed_at":"2026-08-15T15:47:21.191082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.016126Z","title":"The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation , August 2025","venue":null,"work_id":"80af8e7b-9f87-4ef1-90a9-9974d2c7cd13","year":2025},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.195198Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:468d5e6bc1a704d77fbadc202b8f84b2d37161130f1acb4127d122608bd99513","observation_id":"42490883-eacb-40aa-9618-25eb19f76c80","resolution":{"observed_at":"2026-08-15T15:47:22.022615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:21.993988Z","title":"Lafter: Label-free tuning of zero-shot classifier using language and unlabeled image collections","venue":null,"work_id":"178692c0-c838-4334-bb1f-28f33a153adc","year":2023},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.198933Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:4f5b0be582ca55c37f8ce07debd435af227e813e0e3bff56cfc8c2630f36aa81","observation_id":"f18667f4-307f-4d7c-b4ea-65ca6c822495","resolution":{"observed_at":"2026-08-15T15:47:21.999220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:21.971041Z","title":null,"venue":null,"work_id":"160389ed-46a9-4730-8f16-6eb39b9f53c2","year":2025},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.202438Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:e48d1d99b78f65e6450609451c53401a55a9980640eb847f5f4353873e30bce9","observation_id":"62648a1b-cc44-408d-be5c-3143792037bd","resolution":{"observed_at":"2026-08-15T15:47:21.976497Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:21.953409Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":"aafe744d-f03a-4809-b942-27d54eeb69c3","year":2024},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.207164Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:5a4d7a82cfe14898e8b3b35e00251ada9fb0a3792375ca1e841dafa8c882f5e4","observation_id":"a51e2431-9cff-4337-bf93-b9962ae81c41","resolution":{"observed_at":"2026-08-15T15:47:21.959217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:21.931304Z","title":"OpenAI o3 and o4-mini System Card , August 2025","venue":null,"work_id":"2f5620f5-f006-4a15-bebf-213937561e4d","year":2025},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.212289Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:f7197ad14275edc47399763809c202f95e9135acdf5bb594c03921ee0aa81b39","observation_id":"e2626458-faec-4587-b9ce-05513ee4366b","resolution":{"observed_at":"2026-08-15T15:47:21.937484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:21.916545Z","title":"Teaching clip to count to ten","venue":null,"work_id":"94ed625d-99e3-4f78-9d71-fcc9bb2a37b0","year":2023},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.217036Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:5e869a8903ce6e7c92f31794542a571b9f22ddd7bc5c1fd44d067c57d95d2c14","observation_id":"9bac3cc7-64ce-441a-89c8-b9b6b325e354","resolution":{"observed_at":"2026-08-15T15:47:21.921064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-15T15:47:21.221916Z","title":"Humanity's last exam, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.221916Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:ed0ac56cd7de212fd806f3038968708d91fef745436866fe875433636bb836b7","observation_id":"f1cdcc5b-8858-4d7c-b2c6-f3db5c05edca","resolution":{"observed_at":"2026-08-15T15:47:21.221916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19903","last_updated":"2025-08-03T07:13:40Z","snapshot_observed_at":"2026-08-16T12:46:53.807059Z","submitted_at":"2025-03-25T17:58:37Z","title":"Scaling Vision Pre-Training to 4K Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19903","snapshot_observed_at":"2026-08-15T15:47:21.226501Z","title":"Scaling vision pre-training to 4k resolution, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.226501Z"},"links":{"cited_paper":"/paper/2503.19903","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:699749d729c846dc9c9d49281973e87cf67e7af99d57a3fe90a2d8624000949d","observation_id":"d4652664-a200-4bfb-8d52-05d83c12a132","resolution":{"observed_at":"2026-08-15T15:47:21.226501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-08-15T15:47:21.230285Z","title":"Paligemma 2: A family of versatile vlms for transfer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.230285Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:a1489836667d0e2ee59d15440130f365d0e4e2c50539c993f5cb0310a2a8acf5","observation_id":"cc0ec413-9a2b-4721-a793-212da32eeb2b","resolution":{"observed_at":"2026-08-15T15:47:21.230285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:21.234168Z","title":"Winoground: Probing vision and language models for visio-linguistic compositionality","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.234168Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:4b6955ab32b17aa83e63b3792e0e14e16a27533423b4d6dc91628aaa16a9190f","observation_id":"7c5975e3-ade4-440b-9b3b-f59e1b89f7b2","resolution":{"observed_at":"2026-08-15T15:47:21.234168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:21.238120Z","title":"Chi, Quoc V Le, and Denny Zhou","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.238120Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:957dbc40efbcf6fdca6cfbf55c503c606a847129ffffef0ae1301db93bd58461","observation_id":"45a2fec2-73df-4032-b5fc-bf50c58878fd","resolution":{"observed_at":"2026-08-15T15:47:21.238120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14181","last_updated":"2024-01-01T14:48:48Z","snapshot_observed_at":"2026-08-18T22:49:12.570713Z","submitted_at":"2023-09-25T14:43:43Z","title":"Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14181","snapshot_observed_at":"2026-08-15T15:47:21.242391Z","title":"Q-bench: A benchmark for general-purpose foundation models on low-level vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.242391Z"},"links":{"cited_paper":"/paper/2309.14181","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:934f5745a7c4e936683cf20c1715dd86750d2a257447540918846baa25c11983","observation_id":"1e666cc3-0a11-4a25-9bc3-288cd37cd3c5","resolution":{"observed_at":"2026-08-15T15:47:21.242391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:21.875021Z","title":"V?: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":"60aa6d47-01dc-4f68-af38-a11ddec6b77f","year":2024},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.246432Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:e113e64902be4bbea0175c55db3b5028521cfa4230212f0a135650f0b4678ea5","observation_id":"1c13a608-bfde-4df0-a934-a2a56f5654b1","resolution":{"observed_at":"2026-08-15T15:47:21.881817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-15T15:47:21.249979Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.249979Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:f063c3fb0aaa4ad709608998fdac335295f66a4388cc970f0e84e915fcbfc751","observation_id":"12ca737c-8477-4d65-b0c4-96001c0d6c4b","resolution":{"observed_at":"2026-08-15T15:47:21.249979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00765","last_updated":"2024-12-01T06:08:00Z","snapshot_observed_at":"2026-08-16T13:29:08.314650Z","submitted_at":"2024-08-01T17:59:54Z","title":"MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00765","snapshot_observed_at":"2026-08-15T15:47:21.254143Z","title":"Mm-vet v2: A challenging benchmark to evaluate large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.254143Z"},"links":{"cited_paper":"/paper/2408.00765","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:8f8dbba0c0259077b76b1019e12ed53c9f8f4ca4116d0616704e4dfe4a5fd68d","observation_id":"10f1514b-204d-408f-af04-91d59147c537","resolution":{"observed_at":"2026-08-15T15:47:21.254143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:21.258016Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.258016Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:0b24ff8c290845d37390c77273c121f256f26c57f14e0ef9bcd9411cc8cbe5d8","observation_id":"31e05dc6-e450-4575-8263-99b7c967bfb4","resolution":{"observed_at":"2026-08-15T15:47:21.258016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-14T16:53:05.474750Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-15T15:47:21.261811Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual input and output, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.261811Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:a4bc58b48f09f24bccf6242278279011fccdb6d0bfdb8422ea556198475ac909","observation_id":"480d0587-444c-4c5a-a899-75d96eefc4fd","resolution":{"observed_at":"2026-08-15T15:47:21.261811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:21.857825Z","title":"Yin and yang: Balancing and answering binary visual questions","venue":null,"work_id":"07144a86-b8f1-4182-9971-37a82d11ed90","year":2016},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.265911Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:34b4a5ab1ce5a27e2cdf71e4dea3b3f80fe05148b08508a4b1a2ab83f6aff11c","observation_id":"b23e0a24-5d2f-4bed-807e-4584ed11507a","resolution":{"observed_at":"2026-08-15T15:47:21.864345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-13T10:46:50.834601Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-15T15:47:21.269398Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.269398Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:b800a1826021881a4010c284afff1d72a4f06315fa4f3bcc9fe067ec2b9e0322","observation_id":"cb33b780-0800-415d-8170-c2bf6728fb1e","resolution":{"observed_at":"2026-08-15T15:47:21.269398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05176","last_updated":"2025-06-11T02:54:49Z","snapshot_observed_at":"2026-08-17T07:57:12.232097Z","submitted_at":"2025-06-05T15:49:48Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05176","snapshot_observed_at":"2026-08-15T15:47:21.273387Z","title":"Qwen3 embedding: Advancing text embedding and reranking through foundation models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.273387Z"},"links":{"cited_paper":"/paper/2506.05176","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:9650a0a2b764223d76a17a8e677cfb6c25f51f5401ac59f61f4547d88e236f6b","observation_id":"63efc223-c776-498c-bac0-d3b890c6cbae","resolution":{"observed_at":"2026-08-15T15:47:21.273387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18415","last_updated":"2024-11-03T18:23:45Z","snapshot_observed_at":"2026-08-16T13:48:30.206280Z","submitted_at":"2024-05-28T17:57:06Z","title":"Why are Visually-Grounded Language Models Bad at Image Classification?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18415","snapshot_observed_at":"2026-08-15T15:47:21.277306Z","title":"Why are visually-grounded language models bad at image classification? arXiv preprint arXiv:2405.18415, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.277306Z"},"links":{"cited_paper":"/paper/2405.18415","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:2e8d5c75c2c4bdb023201a486f2b7c76a326a414058645a2a4e22c204a4289ed","observation_id":"62803457-e2fe-4e8e-8a31-9fc12368c114","resolution":{"observed_at":"2026-08-15T15:47:21.277306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:21.835540Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":"5e740341-3f20-410d-b81c-7426403b274d","year":2023},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.281527Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:e3357d46aff8d28de6ea57fbd3d6deb695dfc795a6c488386a10f0b0094ae077","observation_id":"6054d7eb-f7fb-4438-a0a0-69574ec18ba8","resolution":{"observed_at":"2026-08-15T15:47:21.844294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-15T15:47:21.285423Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.285423Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:546ac04f5d460c8d7849c9bd0d71f89a05eb04014acb28259bbb2bdc1ed7ddba","observation_id":"c7314233-8846-4750-9ec1-ab18580096ea","resolution":{"observed_at":"2026-08-15T15:47:21.285423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:21.289600Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.289600Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:4068282e4a7fbc8659825d851f66998725100f37b3e7866a706fe4136ee2d700","observation_id":"36af6328-f6f0-4cdb-b958-695a745e5880","resolution":{"observed_at":"2026-08-15T15:47:21.289600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:21.294663Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.294663Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:e5e1bf92fc149fed63c3dccb9a0a2f2576e48f2e24aa28269201d88b0896aec7","observation_id":"37e11a02-4912-44fe-8084-ecb42ece83a2","resolution":{"observed_at":"2026-08-15T15:47:21.294663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:21.298721Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T15:47:21.298721Z"},"links":{"citing_paper":"/paper/2509.25339"},"observation_digest":"sha256:5d10f78e871aa5da05fde1d7bf568666529de0d3b02044cfdc3a1afba73005ce","observation_id":"64999212-2f4a-430a-a251-1ef55cd8d540","resolution":{"observed_at":"2026-08-15T15:47:21.298721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.25339","last_updated":"2026-05-24T10:24:38Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T13:44:23.472388Z","submitted_at":"2025-09-29T18:00:25Z","title":"VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2509.25339."}