{"as_of":"2026-08-05T00:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da47ad750be6e4bd2f041358f90c48cf0bf10c0c9e7f822dedcb3d2c7032872d","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T22:47:46.542267Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.31148/citation-record","integrity":"/paper/2605.31148/integrity","json":"/paper/2605.31148/citation-record.json","paper":"/paper/2605.31148"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Placeit3d: Language-guided object placement in real 3d scenes","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:ffff4c10b259896f3731c710f9f1ce5f3ab8aea07fe5cd37d8dd8fc3f56e9c4f","observation_id":"9defce82-bb36-428b-bbcc-9d34b1558c03","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Gemini-3.1 pro","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:559337be7a7ede3613f9e6940205b13f57170f3311d8f4ce5a068c2e8d238a4b","observation_id":"c88463bc-9241-4132-9c8e-455242d8ecf2","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Scanedit: Hierarchically-guided functional 3d scan editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:fa0fe8c6fa28c311932877add8f0957e550ca65204aecc38054ec5c90380e99b","observation_id":"395fc00e-7781-4061-a7c8-bff1666a8a2b","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16299","last_updated":"2026-04-17T17:59:50Z","snapshot_observed_at":"2026-08-03T01:59:43.264555Z","submitted_at":"2026-04-17T17:59:50Z","title":"Repurposing 3D Generative Model for Autoregressive Layout Generation","version":1},"cited_work":{"arxiv_id":"2604.16299","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.16299","snapshot_observed_at":"2026-06-28T22:52:45.648338Z","title":"Repurposing 3D Generative Model for Autoregressive Layout Generation","venue":"cs.CV","work_id":"6fc03ecf-ca9f-41b3-8681-1cd442059f77","year":2026},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"cited_paper":"/paper/2604.16299","citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:d305a75262fa81438e534f7c016396012402be5ee71d3f3cd8ee8db1080fed1d","observation_id":"183ade7e-ec5a-4b58-a3d4-b0274a29fa85","resolution":{"observed_at":"2026-06-28T22:52:45.649456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Layoutgpt: Compositional visual planning and generation with large language models.Advances in Neural Information Processing Systems, 36:18225–18250, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:80b09f38a706c934aedc8d0690e806e7ed3d43dce226a9f04f0b177437eee256","observation_id":"cb976fd4-dd60-4d99-b28e-56a9e309d5db","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.26752","last_updated":"2026-05-12T15:07:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-29T14:49:37Z","title":"GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents","version":3},"cited_work":{"arxiv_id":"2604.26752","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.26752","snapshot_observed_at":"2026-07-04T10:09:45.391749Z","title":"GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents","venue":"cs.CV","work_id":"0b17ea7d-55ea-42eb-b903-68fb980f9a60","year":2026},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"cited_paper":"/paper/2604.26752","citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:5eca104b6c4b71ab34d1ce6801ed2cfe8c5c2ac00b7fd676b25c7d9344aeb95d","observation_id":"58e58408-69c2-4b73-bdf8-af4a224bb64d","resolution":{"observed_at":"2026-06-28T22:52:45.651730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Fireplace: Geometric refinements of llm common sense reasoning for 3d object placement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:df401b8821b63c6b324a2f11770bb510a30c22222fae5428435b4b07a182f8c9","observation_id":"527711ea-d5d9-43bc-a49a-6af4ab464910","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13394","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T16:44:56.049759Z","title":"Spatial-dise: A unified benchmark for evaluating spatial reasoning in vision-language models","venue":null,"work_id":"1b8bfd94-e08b-4e1d-bc47-bef2662deb1e","year":2025},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:8be54ff23ff15e66e0b467f2d93a038653a1c529b9eebb0ffce4de7db792732d","observation_id":"889aa6f0-bf32-4c0d-a6bb-86e02a2f4be3","resolution":{"observed_at":"2026-06-28T22:52:45.654255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Do you see me: A multidimensional benchmark for evaluating visual perception in multimodal llms","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:e8b417b4dbdb6f8be37a81cca38375aaa761f1b5eeca725524491bedb6ae22d9","observation_id":"4e520516-14ae-456a-a8f0-c68dd39449be","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.21500","doi":"10.48550/arxiv.2505.21500","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Viewspatial-bench: Evaluating multi-perspective spatial localization in vision-language models.ArXiv, abs/2505.21500","venue":null,"work_id":"4e64344e-47c6-4d04-a5a4-c05266da7d8c","year":2025},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:20ea582eda9e597341d35a3194b9996d211e4fb89fbe10d9018db15bdd9a0be4","observation_id":"41cfa93a-29cd-418a-ab55-bd0bb52586af","resolution":{"observed_at":"2026-06-28T22:52:45.656882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Embodied agent interface: Benchmarking llms for embodied decision making","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:0545a65da4cb5efa19d72af5f8c7ddab5cdf2505ea5baa75c16372ab7ff8610d","observation_id":"9c1c9787-8eb6-4c9b-8ecf-4579c5edccf8","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10855","last_updated":"2025-06-19T03:48:50Z","snapshot_observed_at":"2026-08-04T20:21:35.651005Z","submitted_at":"2024-10-06T20:13:11Z","title":"Core Knowledge Deficits in Multi-Modal Language Models","version":4},"cited_work":{"arxiv_id":"2410.10855","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10855","snapshot_observed_at":"2026-07-02T17:37:14.719889Z","title":"Core knowledge deficits in multi-modal language models","venue":null,"work_id":"1b1d3166-eab5-4fb2-b288-18730b4e780d","year":2025},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"cited_paper":"/paper/2410.10855","citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:268ff5fc0472101dd29d52b8c71a7b21455055fe980ef1fa29b9cc433009375f","observation_id":"34651ba5-d003-4d40-9e8f-04ed8d779eda","resolution":{"observed_at":"2026-07-01T19:16:01.160739Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15722","doi":"10.48550/arxiv.2511.15722","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Spatial reasoning in multimodal large language models: A survey of tasks, benchmarks and methods","venue":null,"work_id":"6a89950e-e68f-4ee1-92ca-4c617487ec7c","year":2025},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:9b6adc5117c79f2061e1862f2373e267c14797f50b4158e98106452d36536b46","observation_id":"87be5ba3-0d53-4c46-a9cc-05ccccf50ec2","resolution":{"observed_at":"2026-07-01T19:16:01.155277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Openeqa: Embodied question answering in the era of foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:eeee2b7108bc317f1f5596c9ed4b2811c23799c07fa1e9d1565450c736defa68","observation_id":"402da64e-ed34-4f2a-83f1-6e795d61cbe1","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Gpt-5.4.https://openai.com/index/introducing-gpt-5-4/, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:13f70d0fdf4ceeee56945a5b0f00379ab204303272afed6d583b1ac64bbbb794","observation_id":"28fc1866-c84b-4107-b232-3b95bced9820","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Qwen3.6-27B: Flagship-level coding in a 27B dense model, April 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:298d3aeab02c2287c8221fd2c09a9d283d1aedcc9e72c0a21f4cd411fe6e09f3","observation_id":"c33b1710-2012-4dc1-8b5f-fb3176e6aa64","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Qwen3.6-35B-A3B: Agentic coding power, now open to all, April 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:027a8613bda9b77f9ac36320f26e489320979dce77bea09ad8d6c74c76d4e445","observation_id":"8adb51d0-8853-4ffe-9bde-69537a55485b","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-03T13:03:43.962537Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Vision language models are blind","venue":null,"work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:03e375f4f97f2665c02ad53095b95da6e8673716ee83a6a431c4df56d31d8470","observation_id":"d137ed69-6c52-4aad-b193-8cee47b04f23","resolution":{"observed_at":"2026-06-28T22:52:45.666857Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06468","last_updated":"2025-04-18T03:53:04Z","snapshot_observed_at":"2026-07-06T19:30:04.518857Z","submitted_at":"2024-10-09T01:41:49Z","title":"Does Spatial Cognition Emerge in Frontier Models?","version":2},"cited_work":{"arxiv_id":"2410.06468","doi":"10.48550/arxiv.2410.06468","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.06468","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Does spatial cognition emerge in frontier models?","venue":null,"work_id":"3b14dc8a-b358-42b9-a836-8ea9bf19c909","year":2024},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"cited_paper":"/paper/2410.06468","citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:467464526ccc62d4ab1914cfa71da5d83116fff67399fe8cb0e2e4789c8faf2a","observation_id":"d5fbae3c-6a59-457f-bf9d-62b66a9d59b1","resolution":{"observed_at":"2026-07-01T19:16:01.154262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Layoutvlm: Differentiable optimization of 3d layout via vision- language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:5184f5d3b2f371a21cdfa4e5c19bc73325e7f14e6cd5c051088fa2cd5bdc7725","observation_id":"7d6b5f4d-bd6e-4fd2-ae96-bc525ddac2ef","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09606","last_updated":"2026-05-26T09:02:06Z","snapshot_observed_at":"2026-08-04T10:37:28.653177Z","submitted_at":"2025-10-10T17:59:46Z","title":"SpaceVista: All-Scale Visual Spatial Reasoning from mm to km","version":2},"cited_work":{"arxiv_id":"2510.09606","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.09606","snapshot_observed_at":"2026-07-03T16:18:37.303298Z","title":"Spacevista: All-scale visual spatial reasoning from mm to km","venue":"cs.CV","work_id":"846c4e70-004d-47c7-a2b5-2d9067a694f6","year":2025},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"cited_paper":"/paper/2510.09606","citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:6804121b79961ee987e771af9234d5773b63620158733fafac4f75b51f604a6b","observation_id":"3abb5795-8fb8-4a04-83e3-f8def5e15c0f","resolution":{"observed_at":"2026-07-01T19:16:01.156980Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Kimi k2.5: Visual agentic intelligence, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:d8539017d542706339ab5f0cf8df726d10fbc4a297555e1a61338a8017b80de0","observation_id":"39770aa2-0783-4818-b3e7-fbb41d9fc165","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Is a picture worth a thousand words? delving into spatial reasoning for vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:51f34b6fedab37d20699169aca12c16061e6ca6a3ac00db8f39275e160065afa","observation_id":"062363fa-4c4f-4810-9295-82c8a5ebe7c1","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.18005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:52:45.665738Z","title":"Raisecity: A multimodal agent framework for reality-aligned 3d world generation at city-scale.arXiv preprint arXiv:2511.18005, 2025","venue":null,"work_id":"27829282-d212-4b0e-83ad-3e7c0c4a1479","year":2025},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:647663807bdae107fefc32371ac7d0d6881289df7fe8a592bb3e5a8c5529504c","observation_id":"eec17679-0fa4-4514-8190-c4f898e91af4","resolution":{"observed_at":"2026-06-28T22:52:45.667323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Embodied scene understanding for vision language models via metavqa","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:4897edbf94b245ff8a9e194e2e4adb25e3a89308838e380bb5c4f39dca2be0cb","observation_id":"d6a48103-f77f-449d-a06a-aa163513ea57","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Site: towards spatial intelligence thorough evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:ec324911b7c7f093292f1761b9449cc1d2447ea33ff1d83a4e9213eaf7b2244c","observation_id":"7a9bc7f3-b327-4305-a735-fd06fa2f5f9a","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Spatial457: A diagnostic benchmark for 6d spatial reasoning of large mutimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:961316b67e6f8b37ad032647e9802ed6e2671f8c348bc8fcbfd77e73ce498745","observation_id":"c24158f4-458a-4e7e-9f64-0924bf6b9e9f","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Visual room rearrange- ment","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:c5da519bdcf8d6f474a368ec5464de489b159ee6f48e79a4ad141baba8a3cc2e","observation_id":"b2325f0d-1813-431c-8b06-bdc3f95f59af","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Spatialtree : How spatial abilities branch out in MLLMs","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:f3232e8248033012e2bcdcc31bcb71033b13a7387f76789b6f2a5a5dd1df2bff","observation_id":"35661b05-bba2-4e93-90c8-8ca555bb050c","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.14339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:49:42.491648Z","title":"CityCube: Benchmarking cross-view spatial reasoning on vision-language models in urban environments","venue":null,"work_id":"b4e47a3c-8a4b-4962-b6a5-4474d3015d9d","year":2026},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:760830318f5dda246c6fc1884093234ed51f51c84c1cdbaac457ea9869901904","observation_id":"f1a7da44-6e1a-4a81-acc0-c9c1886e1067","resolution":{"observed_at":"2026-06-28T22:52:45.661726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Defining and evaluating visual language models’ basic spatial abilities: A perspective from psychometrics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:5ccce781bbcc5ff085ff72b635927ff4410f99b0ac4d4daeb5b2750c25de35a9","observation_id":"4afe071f-2a15-43f4-8ea3-71ba977465bb","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:4991a384350b93159101421d414e23663c6ad0c97304a91a8dc1d4e2686bea0f","observation_id":"dc9d0108-100e-4a2e-9837-0e8876ac5551","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Holodeck: Language guided generation of 3d embodied ai environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:e6d601aa5e7127b5ec0b68965d24df5885a450bf6f490b360b1b67fc2fc2644b","observation_id":"75bb97db-8f79-4e4b-9735-31f12aaee948","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Spatial mental modeling from limited views","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:cd39f92fa4528d42d8b94014a0ad29bc90f44ff804169dd18418f603fee0b5c5","observation_id":"e3e8ec7c-3825-49d0-b65b-4c3078aea8ec","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:49:42.516795Z","title":"arXiv:2509.18905 (2025) 6, 9, 17","venue":null,"work_id":"c55c3b64-e350-41a8-a984-776566437b05","year":2025},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:c72dbda3c368950ac088b004c4059878b53f88c6e78f79eaa772988b16defed5","observation_id":"e4e13388-034e-4a2c-9609-348c0e85f46d","resolution":{"observed_at":"2026-06-28T22:52:45.662040Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Et-plan- bench: Embodied task-level planning benchmark towards spatial-temporal cognition with foundation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:34eee61f20b3f4f086d93385a3b421b097b76a2465c95daa710673ba47936ada","observation_id":"15ad3398-d24d-48d0-8787-6dd67acdcac4","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Theory of space: Can foundation models construct spatial beliefs through active exploration? InThe Fourteenth International Conference on Learning Representations, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:80e4a742e98100781b26309a768481c33204cd0f5b81b0bcdcbbd3dce5cd1d94","observation_id":"ecb79f32-8aa3-4e05-9154-9da03777d856","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"SPHERE: Unveiling spatial blind spots in vision-language models through hierarchical evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:a4fd9cee56ebe03ea5cb1c69fa1b8cf767430bca7d4a9db030c040211ea0c6eb","observation_id":"6cdeccad-6bfc-4953-b7e2-69469410851f","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:bcd063e19b292a7e3cd7208263bfeb8ebcfe8fccb0e6bf042082fdf16f41b841","observation_id":"331979fc-5656-4070-abbf-1e0d018efdb4","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:47:46.542267Z","title":"Cityeqa: A hierarchical llm agent on embodied question answering benchmark in city space","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:efcaecdb283b41cde5b5fa4cd7431a2ff6ebde34837786789c0d6fee66d221e9","observation_id":"d1670f69-e4a6-4a2d-96d0-9f1da2a7c030","resolution":{"observed_at":"2026-06-28T22:47:46.542267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.22279","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:52:45.663150Z","title":"3d-layout-r1: Structured reasoning for language-instructed spatial editing.arXiv preprint arXiv:2603.22279, 2026","venue":null,"work_id":"4131fca1-7336-433d-8ae2-9dc922c66a75","year":2026},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:8fc6ca9ace69d71a58d7aa4900a5b1fb907f499358147a49379fc406124a3599","observation_id":"e187df64-a2be-4430-b8dd-084a787d2d91","resolution":{"observed_at":"2026-06-28T22:52:45.664638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10813","last_updated":"2026-04-28T04:11:01Z","snapshot_observed_at":"2026-07-06T22:29:38.297334Z","submitted_at":"2025-09-13T14:25:17Z","title":"InternScenes: A Large-scale Simulatable Indoor Scene Dataset with Realistic Layouts","version":4},"cited_work":{"arxiv_id":"2509.10813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.10813","snapshot_observed_at":"2026-07-10T23:17:45.647946Z","title":"InternScenes: A Large-scale Simulatable Indoor Scene Dataset with Realistic Layouts","venue":"cs.CV","work_id":"d60a2268-6de6-4160-b967-d34c5e76b7f3","year":2025},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"cited_paper":"/paper/2509.10813","citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:7d1c30d8c3be443c859f604c34fbaf808df34956869b5960ac98f43724a13eea","observation_id":"2c07ae8b-5559-4680-848b-53e748b90322","resolution":{"observed_at":"2026-06-28T22:52:45.669731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":28,"verified_exact":13,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2605.31148."}