{"as_of":"2026-08-09T16:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:07f9190aad374a096a40cef70b94c34c01cf1c413bf86463cbadb47e37b22ec1","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:41:26.959722Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:27:53.149718Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:19:57.696188Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"cited_work":{"arxiv_id":"2506.04633","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04633","snapshot_observed_at":"2026-07-04T16:19:57.696188Z","title":"Unfolding spatial cognition: Evaluating multimodal models on visual simulations","venue":null,"work_id":"52164092-efa3-4259-af54-ade84d61e1b3","year":2025},"citing_paper":{"arxiv_id":"2512.10941","last_updated":"2026-04-30T17:59:42Z","snapshot_observed_at":"2026-07-06T22:38:45.907386Z","submitted_at":"2025-12-11T18:59:08Z","title":"Mull-Tokens: Modality-Agnostic Latent Thinking","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T22:57:04.802871Z"},"links":{"cited_paper":"/paper/2506.04633","citing_paper":"/paper/2512.10941"},"observation_digest":"sha256:a4a370f0b1d19afcfd31429456acf5380ad5e5cd58137b8383b2a4cf90412390","observation_id":"cd63e26c-445d-4a10-95c2-ca6f34c69f95","resolution":{"observed_at":"2026-05-16T22:58:38.627648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04633","snapshot_observed_at":"2026-08-03T05:23:33.575141Z","title":"Unfolding spatial cognition: Evaluating multimodal models on visual simulations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02465","last_updated":"2026-06-10T12:52:04Z","snapshot_observed_at":"2026-08-08T05:57:49.430723Z","submitted_at":"2026-02-02T18:49:06Z","title":"MentisOculi: Revealing the Limits of Reasoning with Mental Imagery","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T05:23:33.575141Z"},"links":{"cited_paper":"/paper/2506.04633","citing_paper":"/paper/2602.02465"},"observation_digest":"sha256:023b2ad105907304773c9149ac2ae7a921d7014d233cda77d689aef1698ddc4e","observation_id":"69efb2fc-e3d1-422b-aba1-8d09447f2e97","resolution":{"observed_at":"2026-08-03T05:23:33.575141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"cited_work":{"arxiv_id":"2506.04633","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04633","snapshot_observed_at":"2026-07-04T16:19:57.696188Z","title":"Unfolding spatial cognition: Evaluating multimodal models on visual simulations","venue":null,"work_id":"52164092-efa3-4259-af54-ade84d61e1b3","year":2025},"citing_paper":{"arxiv_id":"2602.11635","last_updated":"2026-04-08T16:46:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-12T06:37:55Z","title":"Do MLLMs Really Understand Space? A Mathematical Reasoning Evaluation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T03:39:28.364183Z"},"links":{"cited_paper":"/paper/2506.04633","citing_paper":"/paper/2602.11635"},"observation_digest":"sha256:ebea9876919a5d51d56e40f39049870cd0cd79ef0933d8857e1c31be764a7103","observation_id":"6117d801-52b2-4a3b-b5aa-ebf127aeafc7","resolution":{"observed_at":"2026-05-16T03:40:33.064422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"cited_work":{"arxiv_id":"2506.04633","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04633","snapshot_observed_at":"2026-07-04T16:19:57.696188Z","title":"Unfolding spatial cognition: Evaluating multimodal models on visual simulations","venue":null,"work_id":"52164092-efa3-4259-af54-ade84d61e1b3","year":2025},"citing_paper":{"arxiv_id":"2605.22570","last_updated":"2026-05-21T14:48:35Z","snapshot_observed_at":"2026-08-02T20:47:32.000183Z","submitted_at":"2026-05-21T14:48:35Z","title":"VGenST-Bench: A Benchmark for Spatio-Temporal Reasoning via Active Video Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T07:12:02.612292Z"},"links":{"cited_paper":"/paper/2506.04633","citing_paper":"/paper/2605.22570"},"observation_digest":"sha256:591331d896e54d90ac4fe7fc056df7fa04050085de8a1c90cc186b0088931208","observation_id":"d511db07-233c-4a58-94fa-4d685ac5172b","resolution":{"observed_at":"2026-05-22T07:14:42.787822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"cited_work":{"arxiv_id":"2506.04633","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04633","snapshot_observed_at":"2026-07-04T16:19:57.696188Z","title":"Unfolding spatial cognition: Evaluating multimodal models on visual simulations","venue":null,"work_id":"52164092-efa3-4259-af54-ade84d61e1b3","year":2025},"citing_paper":{"arxiv_id":"2606.24539","last_updated":"2026-06-23T13:06:51Z","snapshot_observed_at":"2026-08-02T12:19:25.025255Z","submitted_at":"2026-06-23T13:06:51Z","title":"PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-26T00:46:17.094339Z"},"links":{"cited_paper":"/paper/2506.04633","citing_paper":"/paper/2606.24539"},"observation_digest":"sha256:99e20f1cbaf77d9e45a220aa8b8fd436f61913328a641c38447e9d46bba4f21a","observation_id":"45cd9437-65a1-4a2e-8d80-bb147c1c1eda","resolution":{"observed_at":"2026-07-04T16:19:57.697686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04633","snapshot_observed_at":"2026-07-30T13:52:46.970573Z","title":"Unfolding spatial cognition: Evaluating multimodal models on visual simulations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-30T13:52:46.970573Z"},"links":{"cited_paper":"/paper/2506.04633","citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:d306618ec594b3f1f6da15469c9885be50bd1aa76a86795432ad497725c21ad7","observation_id":"d8dd0d06-f4fa-44d6-bcbc-8191e22529af","resolution":{"observed_at":"2026-07-30T13:52:46.970573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04633","snapshot_observed_at":"2026-08-05T04:27:53.149718Z","title":"Unfolding spatial cognition: Evaluating multimodal models on visual simulations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.149718Z"},"links":{"cited_paper":"/paper/2506.04633","citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:0725e68f85dee1065c60f2235c5acef9ce242977223d9bde5cff68c5e86ef438","observation_id":"b14b3cb5-72ac-49e0-b444-a6d3609feed1","resolution":{"observed_at":"2026-08-05T04:27:53.149718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04633/citation-record","integrity":"/paper/2506.04633/integrity","json":"/paper/2506.04633/citation-record.json","paper":"/paper/2506.04633"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:37.313592Z","title":"Thinking with sketches","venue":null,"work_id":"f3c52dde-b306-4b13-aecd-188c09067db2","year":2009},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:20.793725Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:51da744a8038014d39997d9e23827aa37f709391ec509cce26c8e9b8fa7c6d54","observation_id":"0912da52-be3f-4697-877a-14fb9aeea46e","resolution":{"observed_at":"2026-08-07T10:41:37.374078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:37.155657Z","title":"When it all falls down: The relationship between intuitive physics and spatial cognition.Cognitive research: principles and implications, 5:1–13, 2020","venue":null,"work_id":"909bbaae-115c-4d8b-b1a3-2841e6672c9f","year":2020},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:20.885909Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:f1edc5dd50673e9b0efd1033bf24bb28074d2d7827393a26f048fbae35a691cd","observation_id":"d951961e-f024-4272-8f90-b59d6863fe5d","resolution":{"observed_at":"2026-08-07T10:41:37.223116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:37.027743Z","title":"Pip: Physical interaction pre- diction via mental simulation with span selection","venue":null,"work_id":"5df88ac6-665a-4d63-bdcb-027d8c99ddfe","year":2022},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.013328Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:49a1f042a1b9084d9e6234b0750917e897e46d171b4ec747aaa8e5bca6097527","observation_id":"4714438d-1363-4c42-9ee2-11a8272be7b6","resolution":{"observed_at":"2026-08-07T10:41:37.075925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:36.909945Z","title":"Spatial ability for stem domains: Aligning over 50 years of cumulative psychological knowledge solidifies its importance.Journal of Educational Psy- chology, 101(4):817, 2009","venue":null,"work_id":"ab89935a-2464-4d84-9311-e04cd3c3d4dc","year":2009},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.133143Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:0c96d08d0beaf0a0a3f2975905b2596bab8f78fa228c336cfb3c83e21375f26d","observation_id":"43ecbf05-c71d-413d-b62d-7ad6b7cc771c","resolution":{"observed_at":"2026-08-07T10:41:36.966055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:36.808795Z","title":"Simulation as an engine of physical scene understanding.Proceedings of the National Academy of Sciences, 110(45):18327–18332","venue":null,"work_id":"e4a9d2e1-0a44-4380-975e-71d6d7049706","year":null},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.259948Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:a33852c5a094bb1a066baa46ed23eab92a2aeb745d54f7ebd8a7539222ac4e98","observation_id":"196d5666-a9d0-4534-b9a9-66f0d51539cc","resolution":{"observed_at":"2026-08-07T10:41:36.857840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:36.675023Z","title":"Mental rotation of three-dimensional objects.Science, 171 (3972):701–703, 1971","venue":null,"work_id":"a0bb5c52-c7c0-4dff-a3d3-67162695eadf","year":1971},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.400305Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:7fc8a600652635773e45b337246dac0d061d1db737d14a9317f50c07eb6045c1","observation_id":"6d9429e0-eaa0-4e11-8162-ff16b7d9edca","resolution":{"observed_at":"2026-08-07T10:41:36.727613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:36.547514Z","title":"Mental animation: Inferring motion from static displays of mechanical systems.Journal of Experimental Psychology: Learning, Memory, and Cognition, 18(5):1084–1102, 1992","venue":null,"work_id":"cb310ace-6121-4481-b143-ab7e77d21c4f","year":1992},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.575727Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:45fa88c2ec893b3d33159dd26f694c847be4c4ea08ac72cd0a74d5c2e12de72d","observation_id":"b7a74f73-af91-4e5a-a488-4b737b1de33d","resolution":{"observed_at":"2026-08-07T10:41:36.589751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:36.428038Z","title":"Training spatial cognition enhances mathematical learning in a randomized study of 17,000 children.Nature Human Behaviour, 5(11):1548–1554, 2021","venue":null,"work_id":"eabbce74-258f-49a1-928c-bf9380117c2d","year":2021},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.707476Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:ff086f0457e70bcaa13a75dc2469c204082457a0b6dacb13d63e165ca052d0e2","observation_id":"e16b8699-13d4-40b7-bbaf-ba831b7559ad","resolution":{"observed_at":"2026-08-07T10:41:36.481915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:36.272463Z","title":null,"venue":null,"work_id":"470246e2-e97a-4e3b-881d-4073b447dd00","year":2009},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.770571Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:10d4e962f41023b460c35c86800098cc94eb97b1bb88d221196630680c74195d","observation_id":"16cbcf72-e795-494c-bb45-d6f90efd16a7","resolution":{"observed_at":"2026-08-07T10:41:36.322632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:21.824598Z","title":"Mechanical reasoning by mental simulation.Trends in Cognitive Sciences, 8(6):280– 285, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.824598Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:cf2f3e5728dd287695fa2a28d3fd6abe827f022b4717644d5c344f9695da2063","observation_id":"7ab4ad9a-44f0-4339-b57b-967ec4163f50","resolution":{"observed_at":"2026-08-07T10:41:21.824598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:36.090408Z","title":"Johnson, Justin","venue":null,"work_id":"415efaf3-1469-4e9f-9965-9e6c6fa59ce5","year":2017},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.902807Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:8567861a0f30c6d7d5b64c9e7cef0d21b30cad96dece5a3bb992bf0a915659ae","observation_id":"9947dae2-1db0-4cbe-9cb3-69068dd8cb74","resolution":{"observed_at":"2026-08-07T10:41:36.167135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:35.928193Z","title":null,"venue":null,"work_id":"4432b3b7-d997-4a39-ba89-f19252016e61","year":2019},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.948366Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:6511a61f8acc9e9c08959944040870fd2945308bf4ec155c2e314d1772afac8f","observation_id":"f0d1917b-42e7-42e1-af76-11d18fb9d67d","resolution":{"observed_at":"2026-08-07T10:41:35.986089Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:35.726478Z","title":null,"venue":null,"work_id":"54c58f00-f225-47e5-8bc8-0ff446ed332c","year":2022},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.989769Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:03ee624a354e3839f169255eb1b420e88a94cb13edf822cdb772b2d54b75802d","observation_id":"2f90151b-c29b-49e8-a583-2b5a5a478caf","resolution":{"observed_at":"2026-08-07T10:41:35.816294Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:35.422295Z","title":"Space: A simulator for physical interactions and causal learning in 3d environments","venue":null,"work_id":"89c96e8a-c468-4b6d-8b4f-10f40e5181ca","year":2021},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.045795Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:4769d615e57d137086fc38314247fb75efb993b88cc80d8c68b86b62cbe0c1a0","observation_id":"b1df8b67-9f1d-4672-8595-0c32531dd4e3","resolution":{"observed_at":"2026-08-07T10:41:35.562021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01547","last_updated":"2019-11-25T13:02:04Z","snapshot_observed_at":"2026-07-06T08:34:41.399203Z","submitted_at":"2019-11-05T00:31:38Z","title":"On the Measure of Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01547","snapshot_observed_at":"2026-08-07T10:41:22.119582Z","title":"On the measure of intelligence.arXiv preprint arXiv:1911.01547, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.119582Z"},"links":{"cited_paper":"/paper/1911.01547","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:a66a3cacce80a84ce1fc562d0b3a21a86b8096cf010937d30324eaf440d6383a","observation_id":"e583c68e-66cb-4a18-9371-f75ea814b02e","resolution":{"observed_at":"2026-08-07T10:41:22.119582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06468","last_updated":"2025-04-18T03:53:04Z","snapshot_observed_at":"2026-08-06T15:03:15.947501Z","submitted_at":"2024-10-09T01:41:49Z","title":"Does Spatial Cognition Emerge in Frontier Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06468","snapshot_observed_at":"2026-08-07T10:41:22.206726Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.206726Z"},"links":{"cited_paper":"/paper/2410.06468","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:7d97381025176459a00f0f9b1002f79380ec8949aee9a8ff418f9628b33d730a","observation_id":"5c065fe2-87e3-400e-9b7f-268312a508bb","resolution":{"observed_at":"2026-08-07T10:41:22.206726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:35.127148Z","title":"Spatial perspective taking: Effects of social, directional, and interactive cues.Memory & cognition, 47:1031–1043, 2019","venue":null,"work_id":"2475413b-0faf-4a4f-bf19-a3ea87e60f0b","year":2019},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.336835Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:8d494e8aa8d7865dd661b710c5d626e98429adbcec5e940f60d871e4393ff0c2","observation_id":"5da8caa2-74c4-4d63-9aef-f68807319458","resolution":{"observed_at":"2026-08-07T10:41:35.259045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:22.447633Z","title":"Shepard and Christine Feng","venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.447633Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:7a2d18be2770cd2924dbd8b267ad7241e36481c60d205abd0abd7429c5b91856","observation_id":"32d4fd57-1bd4-4b63-94be-886ab500accb","resolution":{"observed_at":"2026-08-07T10:41:22.447633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:34.837701Z","title":"Identifying cognitive processes and neural substrates of spatial transformation in a mental folding task with cognitive modeling","venue":null,"work_id":"2d0fe85f-3a21-49d5-8bb7-1e3fd4076074","year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.506235Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:fa8bd73bd6f789075c5a88527554e6341c7f3048a9ed36d337f09c7390e2f960","observation_id":"272fb89b-8626-40c3-a459-36e36b4e9736","resolution":{"observed_at":"2026-08-07T10:41:34.982381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:34.661357Z","title":"Tangram solved? prefrontal cortex activation analysis during geometric problem solving","venue":null,"work_id":"1f660c6f-48b2-4b28-8ef1-b12444c71eb0","year":2012},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.562607Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:d09becc9f65e938709c297aefe144546cb38964fcb53a819fe3e2b6299ea952e","observation_id":"728e303a-4dca-4fd1-8920-a6eae48f7500","resolution":{"observed_at":"2026-08-07T10:41:34.724854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:34.405234Z","title":"Smith, Elizabeth Bonawitz, and Tomer D","venue":null,"work_id":"e8bb8d9e-be29-49fe-bf01-e93810fd4edd","year":2022},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.629643Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:ded31df18c0f89652ed45ce8708294b43e0375798f5b28ccff0c75b5e7ad2a6f","observation_id":"98eed9c3-9a7b-49bd-b0e2-33afe924847c","resolution":{"observed_at":"2026-08-07T10:41:34.524806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:34.213463Z","title":"Allen, Samuel J","venue":null,"work_id":"eb6c8d5f-5399-4e11-8f1c-932e6ba61c51","year":2023},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.722765Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:a87acbb05b3547190343c2fc850c9fa7a0ed53baf064e9f261c05ad41795aba2","observation_id":"137906f4-b475-4eb8-9326-5ad47ca6aa2b","resolution":{"observed_at":"2026-08-07T10:41:34.292203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:34.045024Z","title":"IsoBench: Benchmarking multimodal foundation models on isomorphic representations,","venue":null,"work_id":"dd359712-4b89-4d05-ac7c-a5570b77e7c3","year":null},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.866835Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:b1a5bef091dde0f5a947f9729b5d87b008332930c5b20b49cf4447f991aa69c8","observation_id":"73aee774-5037-4bf3-adb2-ea12c514ccb3","resolution":{"observed_at":"2026-08-07T10:41:34.129317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:33.755918Z","title":"Inter- gps: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":"4e3c6955-856e-4d31-a2c1-69b2694cec57","year":2021},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.932633Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:17a94bcc25b71c66ba34ae8ae5ae84d1cd7296cde1003043deae54419e1ea8f7","observation_id":"608d7af6-1083-442a-8b45-04f47c7150df","resolution":{"observed_at":"2026-08-07T10:41:33.867088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:33.503000Z","title":"Naturalbench: Evaluating vision-language models on natural adversarial samples.European Conference on Computer Vision, 2024","venue":null,"work_id":"fe748ab3-3468-4375-b4d4-fb6584db3b36","year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.035740Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:3657d7547a0e5b7940d607f8b4d18f3694472266fe870e3141d4a1c8f7fd2f68","observation_id":"cd024bb7-94d0-4865-9987-0348153c6fc5","resolution":{"observed_at":"2026-08-07T10:41:33.598352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06209","last_updated":"2024-04-25T07:12:39Z","snapshot_observed_at":"2026-07-06T17:14:32.455890Z","submitted_at":"2024-01-11T18:58:36Z","title":"Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06209","snapshot_observed_at":"2026-08-07T10:41:23.165468Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms.arXiv preprint arXiv:2401.06209, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.165468Z"},"links":{"cited_paper":"/paper/2401.06209","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:913183242e9f7d1250985e9905d752dbb303d7dbe7505068f726bf25c0f8d899","observation_id":"c4d2c4f5-7971-4722-9fd1-74b1712a1143","resolution":{"observed_at":"2026-08-07T10:41:23.165468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-07T10:41:23.231324Z","title":"V*: Guided visual search as a core mechanism in multimodal llms.ArXiv, abs/2312.14135, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.231324Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:2084b1c27578655e341f8800e7aac8894290e0b55ac1552013e7609f631b5ffd","observation_id":"858d4b93-a6c5-4dbe-9a08-d68c203ae2d6","resolution":{"observed_at":"2026-08-07T10:41:23.231324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-07T10:41:23.368760Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.368760Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:d0de576d043b37577f5290e878b73da80bcddbf445f03d188df9c8b91fa6fb25","observation_id":"0ecb08d9-d824-4b1f-abdb-58bfcb12287a","resolution":{"observed_at":"2026-08-07T10:41:23.368760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:23.464893Z","title":"Kiva: Kid-inspired visual analogies for testing large multimodal models.arXiv preprint arXiv:2407.17773, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.464893Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:a176befec2322f4d5e30da9c12c2eaec7dd076f28c09ca713e7b8b683f327c08","observation_id":"2f356048-f564-4d2b-af18-91a3b81ec9cd","resolution":{"observed_at":"2026-08-07T10:41:23.464893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:33.264436Z","title":"Stratified rule-aware network for abstract visual reasoning","venue":null,"work_id":"f81071dc-dafb-4706-8b62-10d4a3c39275","year":2021},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.533862Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:2b52a5c38d7aa7d55881c9d61c791d4d66fc84842d271c11c22e1ce2a1424052","observation_id":"7ab2be5d-134c-4f4d-b7c7-0dcf42280bc0","resolution":{"observed_at":"2026-08-07T10:41:33.347493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00264","last_updated":"2025-04-11T21:25:02Z","snapshot_observed_at":"2026-07-06T19:43:19.201456Z","submitted_at":"2024-10-31T23:52:06Z","title":"TurtleBench: A Visual Programming Benchmark in Turtle Geometry","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00264","snapshot_observed_at":"2026-08-07T10:41:23.611836Z","title":"Turtlebench: A visual pro- gramming benchmark in turtle geometry.arXiv preprint arXiv:2411.00264, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.611836Z"},"links":{"cited_paper":"/paper/2411.00264","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:8442c2dfeb7cf341c71bd7a22ad1e980e6fde0015affc43750fb3647a24c7b8a","observation_id":"d3b7c65a-97f1-40cf-874c-6901c03898b7","resolution":{"observed_at":"2026-08-07T10:41:23.611836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-07T10:41:23.680831Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember and Recall Spaces.arXiv preprint arXiv:2412.14171, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.680831Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:d63a847fb856b41bf4089734d3f5646cf2ce3130aee492af2dc1e27816aa6013","observation_id":"0f79e3a9-2926-4dbb-a7b8-f7c5ce3d8331","resolution":{"observed_at":"2026-08-07T10:41:23.680831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:33.028857Z","title":"Matplotlib: Visualization with python.https://matplotlib.org/, 2012","venue":null,"work_id":"23d31e1c-7ead-451a-ae60-e43818d7e7c9","year":2012},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.846590Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:7ea65ec9bc8f89b43b295c6c91cac197ed8b61c5346ea2a37415125ca5cf9def","observation_id":"74c7ba02-5f4b-417b-bc58-20c3b568562c","resolution":{"observed_at":"2026-08-07T10:41:33.159340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:32.806024Z","title":"Lawrence Zitnick, and Ross Girshick","venue":null,"work_id":"d4d16df5-952b-446d-ad18-8965a69457f4","year":2017},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.901970Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:6a91d76c0f9e0f2e341368a5c575d78827b18ede1037f6d5314859a3fac335ba","observation_id":"cd965a02-8ab3-450d-a21e-5c0d562acc3b","resolution":{"observed_at":"2026-08-07T10:41:32.919995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:32.511501Z","title":"Blender is free software.https://www.blender.org/","venue":null,"work_id":"30d1981b-c7f3-452a-97c8-e8eaeb42422e","year":null},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.963907Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:bd178076309e432f37562f6b41fd7516fe8e7a8133f08b7b867dd412e5526784","observation_id":"f9877b0b-b59d-4196-a61a-f61a68e0ecce","resolution":{"observed_at":"2026-08-07T10:41:32.648660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:32.257246Z","title":"Objectron: A large scale dataset of object-centric videos in the wild with pose annotations.Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2021","venue":null,"work_id":"91b25ab6-b3cf-4ead-9291-dc2db0e64bb7","year":2021},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.121793Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:ae06fb2c5d9dae43c716e64796ab7bc74d4b46c4963b362a2a825ee91e32fde3","observation_id":"c19a609b-3691-442e-9c62-ce6501ac2aba","resolution":{"observed_at":"2026-08-07T10:41:32.352822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08238","last_updated":"2021-09-16T22:01:24Z","snapshot_observed_at":"2026-07-06T11:48:35.206160Z","submitted_at":"2021-09-16T22:01:24Z","title":"Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08238","snapshot_observed_at":"2026-08-07T10:41:24.193550Z","title":"Habitat-matterport 3d dataset (HM3d): 1000 large-scale 3d environ- ments for embodied AI","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.193550Z"},"links":{"cited_paper":"/paper/2109.08238","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:f2944f23ab3d24c635696ec8c2173cad018e8079b638b071012288fbe12977c4","observation_id":"47a74958-324e-48c0-8dac-bc770a1119da","resolution":{"observed_at":"2026-08-07T10:41:24.193550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:32.008723Z","title":"Habitat: A Platform for Embodied AI Research","venue":null,"work_id":"4d36e38b-2b29-4d96-9ab0-e02ce347d93f","year":2019},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.254352Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:80bb60a89403abe18a80d0dd2ff9fd569f9db835b6750ad735fcf3237729cefa","observation_id":"1f4a1073-a72f-40cd-85e1-abc1d38e76c9","resolution":{"observed_at":"2026-08-07T10:41:32.095636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:31.783712Z","title":"Habitat 2.0: Training home assistants to rearrange their habitat","venue":null,"work_id":"f4992c86-32ce-48f8-bcd0-82927153465b","year":2021},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.342330Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:d3aaa42d974abc4774e2ca2115c2b12b5c0cae9446785ed72c3e15604db608d8","observation_id":"f6d896dd-9c9d-46e2-a11c-6e7da8eb5341","resolution":{"observed_at":"2026-08-07T10:41:31.880284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:31.530418Z","title":"Habitat 3.0: A co-habitat for humans, avatars and robots, 2023","venue":null,"work_id":"135c0c14-7cdf-4f73-936c-b6c419905385","year":2023},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.435903Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:262ce0b5b2b9da12179cd21c4aea440b62188065d44bafac5202364de8140120","observation_id":"99575760-05d8-4964-97d8-c36a26e5f764","resolution":{"observed_at":"2026-08-07T10:41:31.650767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:31.311803Z","title":"Hello gpt-4o.https://openai.com/index/hello-gpt-4o/","venue":null,"work_id":"462bea72-cb55-461f-8801-3bc4ecf3d1e2","year":null},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.498308Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:b1f2591ac7dfc184dda1f1740aae60b302fe37aac44420c1055b9ed0c056bde3","observation_id":"47cd2fbe-f174-44c1-be00-5d79ff6c3c5a","resolution":{"observed_at":"2026-08-07T10:41:31.439938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:31.079843Z","title":"Claude 3.5 sonnet.https://www.anthropic.com/news/claude-3-5-sonnet","venue":null,"work_id":"d137dffb-f92c-44bd-aca1-2ab4e3c7389c","year":null},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.556247Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:5d5024633e423bb05256ccfe60b34641ffb84a705822c87eef453161949cb8c7","observation_id":"78305623-c890-4349-b476-f6f84620f118","resolution":{"observed_at":"2026-08-07T10:41:31.136921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:30.906549Z","title":"Introducing gemini 2.0: our new ai model for the agentic era.https://blog","venue":null,"work_id":"986313a1-ddc2-4933-b898-857bbcd1b3ce","year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.620394Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:b09e32a495c84000d5f99480a17295b0d6c769d0a7449ae98fe6396bc44c972b","observation_id":"238a24c9-fffa-44c4-9a20-bbe2932c9c65","resolution":{"observed_at":"2026-08-07T10:41:30.985638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:30.723985Z","title":"Gemini 2.0 flash thinking mode.https://ai.google.dev/gemini-api/docs/ thinking-mode,","venue":null,"work_id":"08bb604f-edf1-4034-9d89-d123fedacc7b","year":null},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.757815Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:57d815efadd66553a8fe90fa3ae4642946ace69dca8a4e8254689985ca77f59e","observation_id":"190756dc-a3b5-40b1-a9ab-3b76cf6e22b6","resolution":{"observed_at":"2026-08-07T10:41:30.797788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T10:41:24.806986Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.806986Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:a0fb17b7cb2cbc4d7ac78f425ba9c7a42eff4ce6bae9ff6c626fb0f3f447d89d","observation_id":"700a4672-8683-4bf7-8009-fda172910fb3","resolution":{"observed_at":"2026-08-07T10:41:24.806986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T10:41:24.877137Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.877137Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:defd3ec66388b729c8fdffa966cf86a4a4ca5a385c3f3c078509425385f8f94c","observation_id":"51ba985d-e5f8-4465-bb94-ac09104a5b5d","resolution":{"observed_at":"2026-08-07T10:41:24.877137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T10:41:24.956325Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.956325Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:3ae9f73448e22e599a402edbceaf9195b54828bb4f6ff3b677c0c72458217b26","observation_id":"f881925d-1a23-4036-822a-89b24315b25b","resolution":{"observed_at":"2026-08-07T10:41:24.956325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T10:41:25.029195Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.029195Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:24e17e82871b18e27956d085f4032b09b952f9ddb2a8c065374c1c9e758d4d77","observation_id":"1301a3c2-07f1-4dae-98f7-a35039693bd2","resolution":{"observed_at":"2026-08-07T10:41:25.029195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:30.503253Z","title":"Structure-mapping: A theoretical framework for analogy.Cognitive Science, 7(2):155– 170, 1983","venue":null,"work_id":"16c19c13-8db2-474a-af5e-fd2bffe09cd6","year":1983},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.113565Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:e86e1e02cd56a542fd1d0ced4cc82341d956a81048630ee44fe80d6bac7f5519","observation_id":"cc904712-0516-4acf-9106-242c2791267a","resolution":{"observed_at":"2026-08-07T10:41:30.576846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:30.312081Z","title":"Carpenter, M.A","venue":null,"work_id":"26f0a0eb-7e41-4347-bdef-28c6fd42dc2e","year":1990},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.164567Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:9b758763da85e0283c3a2735518510ab736ca1520da9c3df8ac676ad9cd470ca","observation_id":"55976ec1-29c8-4560-8a5b-0c0fdcc8dfb4","resolution":{"observed_at":"2026-08-07T10:41:30.414906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:30.159067Z","title":"Lovett and K","venue":null,"work_id":"5e4b29e6-a111-4896-872a-5d422ae019a4","year":2017},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.256258Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:3f11c749ff0e97d346a85ad6f28c16266e3e9ea6cad38a3b8acf095c22d9b3bd","observation_id":"de84bb20-eed0-4d11-9cae-dcc2f20c9010","resolution":{"observed_at":"2026-08-07T10:41:30.236791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:29.991222Z","title":"Holyoak, Alan Yuille, and Hongjing Lu","venue":null,"work_id":"c45705c8-c0f6-469a-ac04-fe909635c5aa","year":2021},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.360747Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:305bfa5192224f270c3a077febcf7710499d5b50f9b9eb9a21407e73afa4f6e6","observation_id":"f055fbe3-4abf-4804-b5ba-9f7518a971eb","resolution":{"observed_at":"2026-08-07T10:41:30.077936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15087","last_updated":"2022-09-29T20:29:26Z","snapshot_observed_at":"2026-07-06T13:57:58.305779Z","submitted_at":"2022-09-29T20:29:26Z","title":"Zero-shot visual reasoning through probabilistic analogical mapping","version":1},"cited_work":{"arxiv_id":"2209.15087","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.15087","snapshot_observed_at":"2026-08-07T10:41:27.187348Z","title":"Zero-shot visual reasoning through probabilistic analogical mapping","venue":"cs.CV","work_id":"7c841ec4-debb-4cde-82d9-832f6b639045","year":2022},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.418282Z"},"links":{"cited_paper":"/paper/2209.15087","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:d746553c2bcd62d9f1c7d88f20b66e3a72646e89c18b96ab79f8064bcfa04a1d","observation_id":"1d0097be-2514-44b6-9f94-3e3387068081","resolution":{"observed_at":"2026-08-07T10:41:27.249937Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:29.821194Z","title":"Ichien, Q","venue":null,"work_id":"304e2b65-47c7-4dfd-8e9d-b99b59867615","year":2023},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.514932Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:b63a862760b34b1a2fc05ed8f720af9d5950514a1653b00aa0bcc32331e5afc0","observation_id":"c4ee8a0b-c1ed-4f9a-9b18-0a19369a228d","resolution":{"observed_at":"2026-08-07T10:41:29.897215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:29.625400Z","title":null,"venue":null,"work_id":"90628075-d57a-4727-aae7-f65a7da63d0c","year":null},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.555845Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:6550e120952ca560b87cf58c5362497f2b974d1db88fdecac0b5476e3bb29151","observation_id":"33724b69-fa75-4fa2-b992-a47e394f0bc0","resolution":{"observed_at":"2026-08-07T10:41:29.717618Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:29.410156Z","title":"Barsalou","venue":null,"work_id":"87bfde27-24c5-40aa-8bcc-6e7289355091","year":2008},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.686267Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:8291df3be429aa17aca4850c9d46bd08fa3196fff1ae2b56b1aef5fe5bd2d60e","observation_id":"2169253e-d8ad-4a4a-8f86-dac3eb855701","resolution":{"observed_at":"2026-08-07T10:41:29.510138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:29.254753Z","title":"Battaglia, J.B","venue":null,"work_id":"66683460-0056-4213-b3c8-ccfb6058f154","year":2013},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.745416Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:3cf5fa9a5d6700f15be696d4e42dac91e650725fa36196f610ced74031dd9808","observation_id":"902ffa29-f1d8-416d-b3d8-6be5d139885d","resolution":{"observed_at":"2026-08-07T10:41:29.332951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:29.065309Z","title":"Tenenbaum, T.L","venue":null,"work_id":"ddfeef30-293f-49db-98c2-3d77f69469bb","year":2006},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.837699Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:d65adacfdda4e9e05ba10377e51f44f4e8de4441ee9949aa3f877ce5e5df738f","observation_id":"18f74f4c-9079-4f9b-9ea2-cd0eae9c750e","resolution":{"observed_at":"2026-08-07T10:41:29.148878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:28.878201Z","title":"Ullman, E.S","venue":null,"work_id":"cd7ec4d3-4790-42de-b46b-f5ea4921b8e4","year":2017},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.912141Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:4e92a6bc9d0261e4e59217d737def602a18065858731c7e5a3ce21741e62b61c","observation_id":"01a12c99-8406-4aca-a230-6c64c059c027","resolution":{"observed_at":"2026-08-07T10:41:28.975241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:28.672225Z","title":"Neural prediction errors enable analogical visual reasoning in human standard intelligence tests","venue":null,"work_id":"e9ca446a-4240-405c-8f9a-abdf636c6fea","year":2023},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.987018Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:a8735deb597e12025cd2aed1384bbb0fab0d6eb98153b171960a10a1839eb1d0","observation_id":"0605e0aa-ed6d-418d-8cce-9801eac4b99c","resolution":{"observed_at":"2026-08-07T10:41:28.782655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:28.520172Z","title":"Piloto, Ari Weinstein, Peter Battaglia, and Matthew Botvinick","venue":null,"work_id":"4a6ced62-2fce-4134-96d1-a9fb1efc5606","year":null},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.096545Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:1f3196f6e0ec6bc0e6362d19107463c764a27ea66e5dccdea949803d753473b6","observation_id":"52be10b7-122e-4afa-883d-2b09bc09c9e5","resolution":{"observed_at":"2026-08-07T10:41:28.579771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08261","last_updated":"2022-06-20T14:27:21Z","snapshot_observed_at":"2026-08-01T17:46:40.019621Z","submitted_at":"2021-06-15T16:13:39Z","title":"Physion: Evaluating Physical Prediction from Vision in Humans and Machines","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08261","snapshot_observed_at":"2026-08-07T10:41:26.158910Z","title":"Bear, Elias Wang, Damian Mrowca, Felix J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.158910Z"},"links":{"cited_paper":"/paper/2106.08261","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:1443bf9f93490d889fe7c181aef98d617fbe47d45fb7abf87e8cca5220a27f0a","observation_id":"acb7d4b5-1705-478c-be8b-542af256c6ee","resolution":{"observed_at":"2026-08-07T10:41:26.158910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:28.344070Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"1ae5520c-08e3-4c60-a36c-52cdd66b3e76","year":2015},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.294741Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:fa9552972e2a178e65b7aa52293590ad2ab123a719649a696b8567b20b1fe364","observation_id":"ab197545-2096-4f0a-98b8-231ae628caa7","resolution":{"observed_at":"2026-08-07T10:41:28.394898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-07T10:41:26.360267Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi.arXiv preprint arXiv:2311.16502, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.360267Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:d00407fabb7b8eba1b3cb9df25ff113687bc44b7fe1696658cdcb449d2aadfd3","observation_id":"7c3e3b65-7e0b-4cb5-b0c5-9f8587c67033","resolution":{"observed_at":"2026-08-07T10:41:26.360267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-07T10:41:26.394433Z","title":"Wang, Robert Gerbicz, John-Clark Levin, Serguei Popov, Fiona 13 Feng, Steven Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.394433Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:ea49fcb870c77a3f3d046a6dde92c00bc850254219d74ba95d4b5e5a0f15aee5","observation_id":"f0a73e54-397b-46bd-a860-c7eac0958067","resolution":{"observed_at":"2026-08-07T10:41:26.394433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-07T10:41:26.476410Z","title":"Mmmu-pro: A more robust multi-discipline multimodal understanding benchmark.arXiv preprint arXiv:2409.02813, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.476410Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:3205dffe6da1b24c5e9890aa0674bbb3b2be44343eaebb7a343a696162dacbb3","observation_id":"f2508680-8974-4c03-8c77-d035eea972e6","resolution":{"observed_at":"2026-08-07T10:41:26.476410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:28.187561Z","title":"Aljunied, Chang Gao, Yew Ken Chia, and Lidong Bing","venue":null,"work_id":"ae198730-ec96-4c68-9dbc-e54af3fd85f0","year":2023},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.578960Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:bd3dd0a1ebdfd365f3c481ff115e18258faf01e75c6e1509b7ff3a88466db27b","observation_id":"fe53eb07-c3cc-4db5-975a-09d59b22efc1","resolution":{"observed_at":"2026-08-07T10:41:28.270034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T10:41:26.638248Z","title":"MME: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.638248Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:175a92d118c4f25faba0ca50d2f3dffadaf3c52e55fc79568bb2fde3d4811c26","observation_id":"4b90d319-04a4-458d-ad51-00b43c934761","resolution":{"observed_at":"2026-08-07T10:41:26.638248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:28.049975Z","title":"MMBench: Is your multi-modal model an all-around player? InProceedings of the European Conference on Computer Vision (ECCV), 2024","venue":null,"work_id":"9aeed3e6-bb14-4c4d-8b7f-b319a354b528","year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.723845Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:3fbaa789c7f6b53433842c3726046d95d59741314433e8b03d4ae841c0ee7ee8","observation_id":"2c880e4f-4445-4f60-ab82-80e29622e449","resolution":{"observed_at":"2026-08-07T10:41:28.090543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-08-07T10:41:26.797359Z","title":"Perception tokens enhance visual reasoning in multimodal language models.arXiv preprint arXiv:2412.03548, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.797359Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:fc205d203447f5830f0100bc4186ebf91b061aac6246195eeee283dfc13a578a","observation_id":"c4bcaab8-ae48-4db9-ab60-0dfbb21133f0","resolution":{"observed_at":"2026-08-07T10:41:26.797359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:27.885097Z","title":"Gon- zalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"621b447a-4451-49e7-8117-578bb36c8368","year":null},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.907731Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:d47a4eb9464d92dfd51d3b68c536ae61a4868ee0a91447035bb88bc03a4c85f8","observation_id":"24c91b08-54a4-4551-a1c7-ffff36c535d7","resolution":{"observed_at":"2026-08-07T10:41:27.980779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:27.732590Z","title":"just in time,","venue":null,"work_id":"1a83469d-d486-4caf-af9c-16dfce9884f5","year":2020},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.959722Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:f225e94bd0277c52047a9150a6f48ec447b516aab0bd9a8fdfbfa227f228276f","observation_id":"35eaf973-71fa-4837-ae78-edde39f956f5","resolution":{"observed_at":"2026-08-07T10:41:27.839293Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":45},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 7 inbound Pith citation observations for arXiv:2506.04633."}