{"as_of":"2026-08-04T17:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ff249ce9bff678c8fdb5e9d3fc3b679a8cb5e835064bf7c62e447cddf734c67e","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T22:34:11.603463Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.10528/citation-record","integrity":"/paper/2604.10528/integrity","json":"/paper/2604.10528/citation-record.json","paper":"/paper/2604.10528"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:97fa8a94fc64077a07b041eeb74f94bc1408fa03d400cb0ade0fe8f709edce30","observation_id":"5b645d1a-c999-44bf-822b-432385986a75","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Ovis2.5: Structural embedding alignment for multimodal large language model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:2bfce0561488badf550d2bc11e56804d30a0e22e86a4dcf4052077032bc65031","observation_id":"3e94dedf-4a22-4964-89e5-d00accf5e328","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Claude 4.5 model card, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:563c3e4b1db979414dd0f89a6ad79e3cc1d95ff2ef1a12661122d0c3904ccfe4","observation_id":"13114dde-0758-4625-a9ed-9d070867ac1e","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:274b2b7dd084565e6e57be11ad76ad97945c154a6379d54ec3d1540e9d5937b1","observation_id":"1f485e2b-12d1-4ba5-bb58-3637d83fb8c3","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Re:Verse - Can Your VLM Read a Manga? InProceedings of the IEEE/CVF Inter- national Conference on Computer Vision, pages 3761–3771,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:f823ca61305334022aadb94b247fa240e96f5583b0a3f5a618f410e9018fb8f4","observation_id":"d4c820be-b9f2-42b3-a7b5-3f95dfa0d930","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Florence-vl: Enhancing vision-language models with generative vision encoder and depth-breadth fusion, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:045be5ad91c629289fcab00f556136e41245b02c7f44a633f1220b8657bbe5b0","observation_id":"e4648a73-0c01-4bd0-b476-3fd020ba58a4","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"The pascal visual object classes (voc) challenge.IJCV, 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:b72700e2233a5477f46a9aa8476d5a17a895aef8e4dcc8a8c8dd277d22c59bf3","observation_id":"22ea92c8-83e6-4c7b-9fe8-8949a65996a4","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Large-scale unsupervised semantic seg- mentation.IEEE TPAMI, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:04aa5344b2baae055738391ac41ffbea87b87b99afebdf14a6e0750ed617059b","observation_id":"0e01b4e4-9dc9-404c-a990-c82b9280962e","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Are vision language models texture or shape biased and can we steer them? InMMFM Workshop @ CVPR, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:9fc757f9a559b9040df7595115776cbd4e34cc9ee706abfa6fdc6fb32368c3b5","observation_id":"b9c50db6-5c30-4e78-9e41-f4bc5ef33af9","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Imagenet-trained cnns are biased to- wards texture; increasing shape bias improves accuracy and robustness","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:dfa401d2e43e0bda1c3f707c294aff496882566e1f0d69d99a22f2a8027ae40d","observation_id":"e750d369-54cd-49c9-b5c2-b7961b001680","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Gemini 2.5: Pushing the fron- tier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:907386725c5f2195c95869796e93ff00b0dfe8ed22948462aa263a8d8ba4c348","observation_id":"cbf4aa75-f6f3-4431-9a27-f1b5f062ce50","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Paligemma: A versatile 3b vlm for transfer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:eb701948ba4a6be88309299ef169238b8e483594dc39bf4c4cb202dd16835099","observation_id":"42e1bb70-3f0d-4960-847c-b999349da81d","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"The origins and prevalence of tex- ture bias in convolutional neural networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:8541394476b65f4d7f5fd93cd4ff1ea96a743ba870c6f2a358b4eb4fd9fe8a9a","observation_id":"37f57ba2-bc06-40d1-bf59-235f01e1438c","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Scaling up visual and vision-language rep- resentation learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:e685271ac73e11c631d6afb5aa9b1ab0b57a9030fc048a9b1ad88b55d4727154","observation_id":"37abc0a1-da38-428a-acae-d88be9cb5122","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:4321dfd07114a58847a0f801a1f97f10d13451588f3bf48dd3897e4d53b3397c","observation_id":"8f7295d2-0886-44eb-99ec-2c8fe24ca07a","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:701f463423ebe9a5e86f2db64b52c244863f87cd36e45217beb0423f9045aeff","observation_id":"54b9f056-af28-4e13-877e-c38e5da08bd0","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Deep learning for thin object segmenta- tion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:cafc9690d4a951c4f1f0131b09d625bf7d2884e4ae7065e26ecfaed41fa3110d","observation_id":"0983e2ea-2123-4f9f-8a57-de8c9e4a96f2","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:3132dd7c5a5117287d8d31a1df07dce4406c0bd5ceb6bf9a199aae2f48661df2","observation_id":"3cfa1c32-2f7e-4734-a723-77fc2ba52f66","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:84a76a66e6ccb3987ff848d43be3ab446c6dbd0b98985947a4e2df1dd40690a6","observation_id":"b462110a-a552-4d00-abd8-ef223407bdb6","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Smolvlm: Redefining small and efficient multimodal models.arXiv preprint arXiv:2504.05299, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:d1399f5b87c3fb857947653021a632ebf574089332773c785d47a608aec23b0c","observation_id":"84f85996-6221-417d-9d1c-52de878c9b2a","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Phi-3 vision 128k instruct, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:f45b179644670c44e1d2efdc6344051096f61697a623e6ad4c43a82eb7f2392c","observation_id":"11cd585e-75da-4f05-936a-57e66565fb4d","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12917","last_updated":"2025-06-17T03:48:16Z","snapshot_observed_at":"2026-07-06T20:53:45.936984Z","submitted_at":"2025-03-17T08:28:58Z","title":"Verification Learning: Make Unsupervised Neuro-Symbolic System Feasible","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12917","snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Gpt-4.1 technical report.arXiv preprint arXiv:2503.12917, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"cited_paper":"/paper/2503.12917","citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:5633618ff6da6ee24f127e03a12a4fbc862b612345e67a13871cb9d95ccc8ded","observation_id":"c078542f-b371-4b1a-87a1-b309e091b85e","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Internvl2.5 pretrained models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:b00ecdc0849a5de10cd970e352afc80289c8224533af2ece90f94c62d9d05237","observation_id":"d1d4d114-b130-4118-b605-31ac9495f4aa","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Robust onion: Peeling Open V ocab Object Detectors Under Noise","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:2f1cb8f63b25282bad78c8a71bf3425c1e8844abffd7c6145087b476eeb3ff3a","observation_id":"80735fb8-fbac-4506-a77b-a67f5672a02a","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Highly accurate dichotomous image seg- mentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:fdeaddb1790a3ba9dcba541005c531f0b49891760632739f76a34d40de859548","observation_id":"e61e22ab-d32d-4ad5-bf9f-a8be7c8c0456","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Qwen2.5-vl: Enhancing vision-language model’s perception of the world at any resolution, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:7947599d62f9e0b5b7a0f5521ffb9fbfa2eb81ebd245763eed405a58d50adb66","observation_id":"b2fd4b0d-4233-4954-824c-007aead7330b","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:343bba8803e2eeb64fe2d8ef98e5f12d9fa2ba2eabb360d292e2461993e3b332","observation_id":"e95c2ff0-0cea-424d-8ac3-90eeace477d7","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:49fab3ee17e99243334478697f0bdf03f684678d2039af656650d81b40a60cd4","observation_id":"5babb2ba-bd7b-4109-a9a8-5cf317b53757","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"The caltech-ucsd birds-200-2011 dataset","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:3f1c5c503abb0c06f8846192341fab8e67adbb407ca19067c556b52b81d5f33f","observation_id":"62df8977-9da1-467e-8634-15088da1f8f4","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:34:11.603463Z","title":"Who’s That Pok´emon?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T22:34:11.603463Z"},"links":{"citing_paper":"/paper/2604.10528"},"observation_digest":"sha256:309c63ab7d1c4d105692d912c6152a71c2cc343c36c2157cd5df4e9a204656dd","observation_id":"0bce14a2-83ae-4496-8e73-f2e4c25667bb","resolution":{"observed_at":"2026-07-12T22:34:11.603463Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2604.10528","last_updated":"2026-06-04T05:47:21Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-12T22:34:09.321020Z","submitted_at":"2026-04-12T08:46:27Z","title":"BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2604.10528."}