{"as_of":"2026-08-07T07:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4f7da82bd00bf820feef2c101c116d5b410da58b2f761bfb1b3f5b2e34606f3d","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T22:30:23.447065Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01709/citation-record","integrity":"/paper/2608.01709/integrity","json":"/paper/2608.01709/citation-record.json","paper":"/paper/2608.01709"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:25.058503Z","title":"MineDojo: Building open- ended embodied agents with internet-scale knowledge,","venue":null,"work_id":"21644ce1-34ae-46a2-bbf6-9287be9bac27","year":2022},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.283714Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:d16adca510193ff968e742138c35bf7cdf7ccd35b6a3fcc074aea16e21d1aa08","observation_id":"87dc45e4-5c3a-4b44-b641-e9305154b74e","resolution":{"observed_at":"2026-08-04T22:30:25.062789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:25.043788Z","title":"Guiding long-horizon task and motion planning with vision language models,","venue":null,"work_id":"526ba7ef-980c-41fa-8a4d-44e542da8a69","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.290888Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:386277c433c02b295d5d7e04889c88c7f33298ad2aaf50d7720038c15b3b193a","observation_id":"0298819c-8cbf-4328-a7a1-ce84e788a605","resolution":{"observed_at":"2026-08-04T22:30:25.048813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:25.029446Z","title":"RoboSpatial: Teaching spatial understanding to 2D and 3D vision- language models for robotics,","venue":null,"work_id":"ae736c87-c8e9-40b7-a0fe-60b69d25b0a2","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.296266Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:6d0502a4584041e5afe4b7ebcedb3a939af8dfd6b9fbf6be7213d1205c839d2a","observation_id":"0e2cf3ad-b986-4786-b06d-431500771a15","resolution":{"observed_at":"2026-08-04T22:30:25.033839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-04T22:30:23.301651Z","title":"GPT-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.301651Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:3f6eddd7e7cf3e0a7afa414df3670b5352c9d8bcfc250b19e88357c2ac255014","observation_id":"e059d53f-7add-4df2-8310-8f46e39ad889","resolution":{"observed_at":"2026-08-04T22:30:23.301651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T22:30:23.306951Z","title":"Qwen2.5-VL technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.306951Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:a360b13448bdff84663ab93f064941bb8adc81ed65d7df5b78bf4c3fd2b2452b","observation_id":"88cd2bc2-5f58-48c9-b623-af5589a23aea","resolution":{"observed_at":"2026-08-04T22:30:23.306951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-04T22:30:23.311855Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.311855Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:42209a97b243f996dfea0b80088c516ad9c76fe9e90e759885efc116d3c599f4","observation_id":"2c2728c8-37d0-4036-a589-887823782f92","resolution":{"observed_at":"2026-08-04T22:30:23.311855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:25.015405Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities,","venue":null,"work_id":"b1b1b967-c535-486f-904f-0ed5b7465fc8","year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.317415Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:6b5513cc8ff85fa85cb85feb4214d38fd7b6d34f5798e3c1a2ccd1617098c82a","observation_id":"c7ba22f9-c844-40a4-a82c-974a8572ea26","resolution":{"observed_at":"2026-08-04T22:30:25.019844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.976499Z","title":"SpatialRGPT: Grounded spatial reasoning in vision language models,","venue":null,"work_id":"ca75ebb4-17bc-4f1b-9dc2-149783362f2b","year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.321859Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:93cc912c46ebe0b396327da4179e7f09fd33884cc9a8df4e9b2d37d676f0aa37","observation_id":"7780fd84-6fd8-4081-a9f1-6dc0f4b9312d","resolution":{"observed_at":"2026-08-04T22:30:23.981742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.961581Z","title":"Depth Pro: Sharp monocular metric depth in less than a second,","venue":null,"work_id":"b4260191-9765-4909-91e5-053f6ddc376d","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.326320Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:567eba402fed171574b3adfd1bdc47c7008733aad3eb44f0e3ed8369a7252de8","observation_id":"0af0b425-a73e-4e18-bdec-9a14837c73c1","resolution":{"observed_at":"2026-08-04T22:30:23.966492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.946556Z","title":"SpatialPIN: Enhancing spatial reasoning capabilities of vision-language models through prompting and interacting 3D priors,","venue":null,"work_id":"6d0cb673-9618-40be-858d-90b265cd59fe","year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.330689Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:9b834ebbb1476b9ecd3d23ba644444fdaad8bfda2fc6485d231e0989e1b2f0c5","observation_id":"c095fd52-af47-432e-bba2-c8b4e30fe240","resolution":{"observed_at":"2026-08-04T22:30:23.951835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.334788Z","title":"Spatial reasoning with vision-language models in ego-centric multi-view scenes,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.334788Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:6fbd5e3f14c8efff307c29c4964024373ddb9965a9d4993e62293a52829085dd","observation_id":"d0a5471f-d938-4158-b714-03cfe772a3aa","resolution":{"observed_at":"2026-08-04T22:30:23.334788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.930430Z","title":"Talk2BEV: Language-enhanced bird’s-eye view maps for autonomous driving,","venue":null,"work_id":"6dfa37d5-deed-4854-a3c4-fabe44c4a2e0","year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.339916Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:d0cef39b21f635655cfd5ffa6835ccf2de897545b14be684a82e9c1905dd63b0","observation_id":"61b5f3fd-bcbb-40fb-8227-3e6125283936","resolution":{"observed_at":"2026-08-04T22:30:23.935532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.915279Z","title":"BLINK: Multimodal large language models can see but not perceive,","venue":null,"work_id":"a553c2c1-822c-4070-b496-c8928317ed32","year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.344222Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:a4a2c0b2735979cf175b26e48677ed0b4777045008618efe5112b5029f05db75","observation_id":"379014f2-0657-4b13-bf6c-f11a96ad612e","resolution":{"observed_at":"2026-08-04T22:30:23.920062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.898029Z","title":"Does spatial cognition emerge in frontier models?","venue":null,"work_id":"135892d7-8c50-4df6-85c4-1a3fbd879ced","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.348928Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:3cff5c9969a7fc380e598b4dc4cf1f77137b919cdc80204cb92ba7d58b1997b9","observation_id":"92576b2f-e40d-428d-b5b6-4d2fece80fc6","resolution":{"observed_at":"2026-08-04T22:30:23.904450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.881672Z","title":"3DSRBench: A comprehensive 3D spatial reasoning bench- mark,","venue":null,"work_id":"7812c326-f5d6-43b6-bb24-3f1f08a4e2e8","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.353214Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:cb60f9c823106152d89c72a601736ad670fb73ce16609c7d219bbc35f0096c40","observation_id":"10da9520-ed85-4023-899a-c9abdafac454","resolution":{"observed_at":"2026-08-04T22:30:23.886760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.865796Z","title":"Do vision-language models represent space and how? evaluating spatial frame of reference under ambiguities,","venue":null,"work_id":"32f9faca-5559-4738-89d6-d64d2b16d47d","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.357336Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:ab95f167456c261da98cf8d193042ca2309ef861c91f571bdd6cc35167f76a09","observation_id":"52425481-1a17-43f5-a128-b77b882d059c","resolution":{"observed_at":"2026-08-04T22:30:23.870793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12969","last_updated":"2024-09-02T16:32:03Z","snapshot_observed_at":"2026-07-06T19:18:21.930632Z","submitted_at":"2024-09-02T16:32:03Z","title":"Seeing Through Their Eyes: Evaluating Visual Perspective Taking in Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12969","snapshot_observed_at":"2026-08-04T22:30:23.362399Z","title":"Seeing through their eyes: Evaluating visual perspective taking in vision language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.362399Z"},"links":{"cited_paper":"/paper/2409.12969","citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:18e163e07883000d3f4ed00cf9cc600bba5cc72c3cd1b8e6e59c5d09f329aa8b","observation_id":"a188f309-9bbc-4fe2-99cd-3c1766bfa726","resolution":{"observed_at":"2026-08-04T22:30:23.362399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.849637Z","title":"Perspective- aware reasoning in vision-language models via mental imagery simula- tion,","venue":null,"work_id":"0bce1e38-5a5d-4634-931c-2730bc40cf01","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.367294Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:983cca2af2212a8c9889977da882a2c03651a7b06afe763a89e8887e76e80fb7","observation_id":"f656a0d9-57bc-4b85-b574-913e22555982","resolution":{"observed_at":"2026-08-04T22:30:23.854558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.833327Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":"c811a26a-4833-4a23-bad3-5b9444837abf","year":2022},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.371626Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:a3ed37f1ed26e8b76f86d1dff767d794d9daf04884500c7abbe6d4d4fe196299","observation_id":"68fe7054-dc93-4cc0-a620-c70ac1b07b1d","resolution":{"observed_at":"2026-08-04T22:30:23.838503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-04T22:30:23.376141Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in GPT-4V,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.376141Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:c04bb83d41f7bd3f809585453a18e7eb5815d3880685f02e82c43296d8699f20","observation_id":"476a93d6-80f9-4514-bf07-ed793b2fd837","resolution":{"observed_at":"2026-08-04T22:30:23.376141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.817047Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models,","venue":null,"work_id":"caf813e6-cfcb-4fb6-9665-f49ff9dcb8ac","year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.381375Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:f70fc046f3bd6d59e3f5aae2a8421f8fd0b29d86fde12a69a591c0d125b0b005","observation_id":"7f30990f-4b6e-424d-8950-e472965b64d5","resolution":{"observed_at":"2026-08-04T22:30:23.822322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-04T22:30:23.385878Z","title":"Qwen-VL: A versatile vision-language model for un- derstanding, localization, text reading, and beyond,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.385878Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:696af16220236c0b1b54dc9b4d5e546e455bca9f8d6916c2f06c62eeffc65dc7","observation_id":"519062f1-9c41-454c-9c55-856aa0b2c012","resolution":{"observed_at":"2026-08-04T22:30:23.385878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.799375Z","title":"Grounding DINO: Marrying DINO with grounded pre- training for open-set object detection,","venue":null,"work_id":"8545f034-84c3-4b5b-99ec-c2e781f985a6","year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.390647Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:392ac8ec81e996ddcc7c99fdfc9f9ed8c5238e2a845666cecda784683321bb21","observation_id":"ca127aa8-a717-4cf9-9b82-6f0af81548ff","resolution":{"observed_at":"2026-08-04T22:30:23.804991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.780072Z","title":"SAM 3: Segment anything with concepts,","venue":null,"work_id":"ce9c2e7b-c7e9-4505-8017-313501afaf03","year":null},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.395556Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:2ef8958493a387a760c748d184f0f49a0f164bb303174a25471eddbacd16d8c9","observation_id":"c9ef6415-a750-4044-bbf2-9d2b8d5436b6","resolution":{"observed_at":"2026-08-04T22:30:23.785581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.762825Z","title":"MM-Spatial: Exploring 3D spatial understanding in multimodal LLMs,","venue":null,"work_id":"16d177d1-e7d2-4e3c-8b86-1f13af228695","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.404699Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:886b91e09173db5e45f2ddb9bd5fc1a15285950680f6df2d4d1161fac52275a6","observation_id":"5d7dcb07-d277-4052-902e-303b3de99b80","resolution":{"observed_at":"2026-08-04T22:30:23.768789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.746419Z","title":"Cubify anything: Scaling indoor 3D object detection,","venue":null,"work_id":"55e6b634-b512-48b1-9d38-ee380c9b7edc","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.409810Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:464dfd2d526d6f28abf9c4a6257db9dcc77f21b9987f30b450e78e480e71363f","observation_id":"5ca7e6ad-3183-4a31-91e3-627813761065","resolution":{"observed_at":"2026-08-04T22:30:23.752144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.728737Z","title":"Visual spatial reasoning,","venue":null,"work_id":"db5e66a0-5b54-480f-bfaf-844d000a7887","year":2023},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.414585Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:3a57a55eed51a8f6b4c8b75ad97d31a351ae3e5f8e1fb74b959d98f6fde3da67","observation_id":"50d942a0-c2a3-4ed8-81c3-544d2814d9e5","resolution":{"observed_at":"2026-08-04T22:30:23.733925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.710724Z","title":"SQA3D: Situated question answering in 3D scenes,","venue":null,"work_id":"d39cc7c2-d283-473c-a350-370cc5888fdc","year":2023},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.419014Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:71a3596bd1546e956bff62932999d19d23a7539edf4d36611ff139f1e6190330","observation_id":"464a342f-43ad-40ed-87d0-2c1a875fdc33","resolution":{"observed_at":"2026-08-04T22:30:23.715872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16170","last_updated":"2023-12-26T18:59:11Z","snapshot_observed_at":"2026-07-06T17:08:12.928414Z","submitted_at":"2023-12-26T18:59:11Z","title":"EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16170","snapshot_observed_at":"2026-08-04T22:30:23.423033Z","title":"EmbodiedScan: A holistic multi-modal 3D perception suite towards embodied AI,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.423033Z"},"links":{"cited_paper":"/paper/2312.16170","citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:0a803cee77ce85378959996b9a9f0235bdff32e124f65741781bc284087dc47b","observation_id":"687b4756-2895-497f-a76b-87570acbe809","resolution":{"observed_at":"2026-08-04T22:30:23.423033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.694378Z","title":"GPT-4o mini: Advancing cost-efficient intelligence,","venue":null,"work_id":"5ac06837-eb8a-488f-9627-44f486530563","year":2024},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.428269Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:f49906a43270d910378778cde23c1b46e700f2855d545cc5e867a7bbc6fa71e2","observation_id":"c9df14e3-ee49-4a38-a992-99480078df7e","resolution":{"observed_at":"2026-08-04T22:30:23.699368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-04T22:30:23.433519Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.433519Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:3f189dc2e065e3627dd7cf6ed39d506f66cb1eefe1c7017eb7833a58213a2fc1","observation_id":"cb2cf448-7aa0-448b-b327-272763c575e6","resolution":{"observed_at":"2026-08-04T22:30:23.433519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.678436Z","title":"SpaceThinker-Qwen2.5VL-3B: A thinking/reasoning VLM for quantitative spatial reasoning,","venue":null,"work_id":"2e58d896-d728-41df-b0c7-b5e229f793e1","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.438252Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:af102b777ae7d923d7a1aa45d25c01ed7e3df4caf49ec49372da92796c05e1ac","observation_id":"3a236af2-8546-427e-8fd4-cb0e601b11cf","resolution":{"observed_at":"2026-08-04T22:30:23.683097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.659761Z","title":"SpaceOm: Spatial reasoning with extended thinking traces,","venue":null,"work_id":"a8fa73d0-3caa-4f5b-836c-4f4077818aea","year":2025},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.442696Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:571dce4eccb92ce634e304e8c6ead382dcb32662ac766a67edcd88172b59e9ff","observation_id":"6ea41c6d-42eb-4ab2-9905-b6372b374b1b","resolution":{"observed_at":"2026-08-04T22:30:23.667452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:30:23.639186Z","title":"Spatial-SSRL: Enhancing spatial understanding via self- supervised reinforcement learning,","venue":null,"work_id":"1f0ea5c0-2642-4dc2-bb14-62eeacc8084b","year":2026},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.447065Z"},"links":{"citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:7a86ddc154ef9a5e039ba50fa4c3d9adc3b2d38d3a2ca0b4adcc9da46fd8c200","observation_id":"4a941714-7708-4e66-a5ee-6ccbe85f1a95","resolution":{"observed_at":"2026-08-04T22:30:23.647404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-04T22:30:23.400209Z","title":"Available: https://arxiv.org/abs/2511.16719","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T22:30:23.400209Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2608.01709"},"observation_digest":"sha256:360294e2f9ed3ca867099be1165b09176ad40e379f3f997dce2c310840e98b7e","observation_id":"d991c080-7989-47ed-92cf-c07e2497874b","resolution":{"observed_at":"2026-08-04T22:30:23.400209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01709","last_updated":"2026-08-03T05:15:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:32:56.839830Z","submitted_at":"2026-08-03T05:15:46Z","title":"SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2608.01709."}