{"as_of":"2026-08-06T17:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4f784b400d79ee467dbb5b31bc6cdff4ee71affb497d8b108153dc5448d60dda","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T23:08:57.431844Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:12:59.576553Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-05T01:50:34.827326Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"cited_work":{"arxiv_id":"2511.07403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.07403","snapshot_observed_at":"2026-07-07T01:16:00.407423Z","title":"Spatialthinker: Reinforcing 3d reasoning in multimodal llms via spatial rewards","venue":null,"work_id":"1d926991-cdce-49ae-9ba1-226aca6c7ec8","year":2025},"citing_paper":{"arxiv_id":"2505.17012","last_updated":"2026-04-13T12:33:41Z","snapshot_observed_at":"2026-07-06T21:28:43.610849Z","submitted_at":"2025-05-22T17:59:03Z","title":"SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T13:07:11.548885Z"},"links":{"cited_paper":"/paper/2511.07403","citing_paper":"/paper/2505.17012"},"observation_digest":"sha256:44a6f63c4f5defa69d591a859cb6321a5fe302124746f3c6b7267694e0d0ca29","observation_id":"6d737bce-47ec-4e2c-8b49-03e8735a432b","resolution":{"observed_at":"2026-07-07T01:16:00.407423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.07403","snapshot_observed_at":"2026-07-13T23:42:44.515158Z","title":"arXiv preprint arXiv:2511.07403 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16506","last_updated":"2026-03-18T04:22:15Z","snapshot_observed_at":"2026-08-02T06:47:16.352514Z","submitted_at":"2026-03-17T13:36:30Z","title":"VIEW2SPACE: Studying Multi-View Visual Reasoning from Sparse Observations","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T23:42:44.515158Z"},"links":{"cited_paper":"/paper/2511.07403","citing_paper":"/paper/2603.16506"},"observation_digest":"sha256:e91298f498c8939994ddf651cdeb02ce60e284aa2e7dfef7353e0330839305b1","observation_id":"34996bd8-253e-4ffe-b57e-554946a45837","resolution":{"observed_at":"2026-07-13T23:42:44.515158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"cited_work":{"arxiv_id":"2511.07403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.07403","snapshot_observed_at":"2026-07-07T01:16:00.407423Z","title":"Spatialthinker: Reinforcing 3d reasoning in multimodal llms via spatial rewards","venue":null,"work_id":"1d926991-cdce-49ae-9ba1-226aca6c7ec8","year":2025},"citing_paper":{"arxiv_id":"2604.21190","last_updated":"2026-06-27T11:24:08Z","snapshot_observed_at":"2026-08-01T20:39:23.931904Z","submitted_at":"2026-04-23T01:19:37Z","title":"SpatiO: Adaptive Test-Time Orchestration of Vision-Language Agents for Spatial Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-09T22:52:22.203519Z"},"links":{"cited_paper":"/paper/2511.07403","citing_paper":"/paper/2604.21190"},"observation_digest":"sha256:24b4d1a8d92991b3fe325ae38dd783392ebf5e429c5ed37f30e1e2df4efd71b6","observation_id":"fc44c71c-409f-4383-b157-2cb6a8ac337c","resolution":{"observed_at":"2026-07-07T01:16:00.407423Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"cited_work":{"arxiv_id":"2511.07403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.07403","snapshot_observed_at":"2026-07-07T01:16:00.407423Z","title":"Spatialthinker: Reinforcing 3d reasoning in multimodal llms via spatial rewards","venue":null,"work_id":"1d926991-cdce-49ae-9ba1-226aca6c7ec8","year":2025},"citing_paper":{"arxiv_id":"2604.21190","last_updated":"2026-06-27T11:24:08Z","snapshot_observed_at":"2026-08-01T20:39:23.931904Z","submitted_at":"2026-04-23T01:19:37Z","title":"SpatiO: Adaptive Test-Time Orchestration of Vision-Language Agents for Spatial Reasoning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-05T01:49:16.845025Z"},"links":{"cited_paper":"/paper/2511.07403","citing_paper":"/paper/2604.21190"},"observation_digest":"sha256:1ad18b109bec328321f08e1593e7921d4efcf42c92eecdf6c9873ee6a395fe2c","observation_id":"c9708611-744c-4878-a6f2-9b9a02fc20ed","resolution":{"observed_at":"2026-07-07T01:16:00.407423Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"cited_work":{"arxiv_id":"2511.07403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.07403","snapshot_observed_at":"2026-07-07T01:16:00.407423Z","title":"Spatialthinker: Reinforcing 3d reasoning in multimodal llms via spatial rewards","venue":null,"work_id":"1d926991-cdce-49ae-9ba1-226aca6c7ec8","year":2025},"citing_paper":{"arxiv_id":"2605.07148","last_updated":"2026-05-08T02:32:27Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T02:32:27Z","title":"Uncovering and Shaping the Latent Representation of 3D Scene Topology in Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T00:56:06.243890Z"},"links":{"cited_paper":"/paper/2511.07403","citing_paper":"/paper/2605.07148"},"observation_digest":"sha256:0b562810cf1cd4050c625129d2d6406195976ab853063559d1dce5c10b0e2ab2","observation_id":"ca4585f3-9bbd-455f-99f5-b88ee5681fbf","resolution":{"observed_at":"2026-07-07T01:16:00.407423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"cited_work":{"arxiv_id":"2511.07403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.07403","snapshot_observed_at":"2026-07-07T01:16:00.407423Z","title":"Spatialthinker: Reinforcing 3d reasoning in multimodal llms via spatial rewards","venue":null,"work_id":"1d926991-cdce-49ae-9ba1-226aca6c7ec8","year":2025},"citing_paper":{"arxiv_id":"2605.10106","last_updated":"2026-05-11T07:20:09Z","snapshot_observed_at":"2026-07-06T23:22:08.560919Z","submitted_at":"2026-05-11T07:20:09Z","title":"ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:00:23.681682Z"},"links":{"cited_paper":"/paper/2511.07403","citing_paper":"/paper/2605.10106"},"observation_digest":"sha256:60be07f1c2ad96e6e539e116a182aa4049a5297e8965d6b44f32c8922c125eca","observation_id":"7b3f3a60-4cf2-4ab3-a2cc-181b3a92d60b","resolution":{"observed_at":"2026-07-07T01:16:00.407423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"cited_work":{"arxiv_id":"2511.07403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.07403","snapshot_observed_at":"2026-07-07T01:16:00.407423Z","title":"Spatialthinker: Reinforcing 3d reasoning in multimodal llms via spatial rewards","venue":null,"work_id":"1d926991-cdce-49ae-9ba1-226aca6c7ec8","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-07-30T02:30:56.837847Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-25T05:10:32.522453Z"},"links":{"cited_paper":"/paper/2511.07403","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:12001432ed0fd7a3b7d62c923caf19755a0c4b5190ec1bd9befe2e19402636a1","observation_id":"b770fcad-f881-40ee-942e-4d520cea9eb5","resolution":{"observed_at":"2026-07-07T01:16:00.407423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"cited_work":{"arxiv_id":"2511.07403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.07403","snapshot_observed_at":"2026-07-07T01:16:00.407423Z","title":"Spatialthinker: Reinforcing 3d reasoning in multimodal llms via spatial rewards","venue":null,"work_id":"1d926991-cdce-49ae-9ba1-226aca6c7ec8","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-07-30T02:30:56.837847Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2511.07403","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:9f2181f8be9c1deb322688654aa4f74900f962f84d341c74d4ba7ba49ab6d5aa","observation_id":"38dfe81d-c142-4e66-b0af-0bf30c46bbe1","resolution":{"observed_at":"2026-07-07T01:16:00.407423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"cited_work":{"arxiv_id":"2511.07403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.07403","snapshot_observed_at":"2026-07-07T01:16:00.407423Z","title":"Spatialthinker: Reinforcing 3d reasoning in multimodal llms via spatial rewards","venue":null,"work_id":"1d926991-cdce-49ae-9ba1-226aca6c7ec8","year":2025},"citing_paper":{"arxiv_id":"2605.25802","last_updated":"2026-05-25T12:51:35Z","snapshot_observed_at":"2026-08-05T08:07:09.530165Z","submitted_at":"2026-05-25T12:51:35Z","title":"Rethinking VLM Representation for VLA Initialization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T22:21:29.733181Z"},"links":{"cited_paper":"/paper/2511.07403","citing_paper":"/paper/2605.25802"},"observation_digest":"sha256:b4cb8dd88f470fa8b306ca3e4526783643f988add92d947162e30e9ec75d9077","observation_id":"0bb8841c-5d38-4287-be56-530b505ae253","resolution":{"observed_at":"2026-07-07T01:16:00.407423Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"cited_work":{"arxiv_id":"2511.07403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.07403","snapshot_observed_at":"2026-07-07T01:16:00.407423Z","title":"Spatialthinker: Reinforcing 3d reasoning in multimodal llms via spatial rewards","venue":null,"work_id":"1d926991-cdce-49ae-9ba1-226aca6c7ec8","year":2025},"citing_paper":{"arxiv_id":"2606.19253","last_updated":"2026-06-17T16:29:19Z","snapshot_observed_at":"2026-08-04T17:52:45.371298Z","submitted_at":"2026-06-17T16:29:19Z","title":"OneCanvas: 3D Scene Understanding via Panoramic Reprojection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T21:38:15.988253Z"},"links":{"cited_paper":"/paper/2511.07403","citing_paper":"/paper/2606.19253"},"observation_digest":"sha256:d5c3b6233abad45d1028355a1bcbfd2108ecc4b19e98b35bd32c29db546c0624","observation_id":"c29adb50-0f1a-4caa-b011-fe7216da0b91","resolution":{"observed_at":"2026-07-07T01:16:00.407423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"cited_work":{"arxiv_id":"2511.07403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.07403","snapshot_observed_at":"2026-07-07T01:16:00.407423Z","title":"Spatialthinker: Reinforcing 3d reasoning in multimodal llms via spatial rewards","venue":null,"work_id":"1d926991-cdce-49ae-9ba1-226aca6c7ec8","year":2025},"citing_paper":{"arxiv_id":"2607.00881","last_updated":"2026-07-01T12:45:12Z","snapshot_observed_at":"2026-08-03T01:24:10.985411Z","submitted_at":"2026-07-01T12:45:12Z","title":"OmniView-Space: Reinforcing Spatial Reasoning via Multi-Perspective Spatial Mapping","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-02T14:16:39.649823Z"},"links":{"cited_paper":"/paper/2511.07403","citing_paper":"/paper/2607.00881"},"observation_digest":"sha256:a4a23f4327cb4645a540ef322fe3965f21de5419aafcec9748dcf49ff4e7de8a","observation_id":"11d137df-2567-4086-9f64-d5816779820b","resolution":{"observed_at":"2026-07-07T01:16:00.407423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.07403","snapshot_observed_at":"2026-07-13T06:42:45.558324Z","title":"arXiv preprint arXiv:2511.07403 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08798","last_updated":"2026-07-08T14:46:54Z","snapshot_observed_at":"2026-08-06T05:37:01.048557Z","submitted_at":"2026-07-08T14:46:54Z","title":"GReFEM: Multimodal LLMs as Zero-Shot Semantic Assistants for Physics-Guided 3D Mesh Refinement","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-13T06:42:45.558324Z"},"links":{"cited_paper":"/paper/2511.07403","citing_paper":"/paper/2607.08798"},"observation_digest":"sha256:30e7cf5ae5b027e0fcdb5aa64c396b0e72a2f7ac21dc677b25056150f5caa844","observation_id":"f5472762-4fe3-4c0a-b2ec-3df3a4fd17b6","resolution":{"observed_at":"2026-07-13T06:42:45.558324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.07403","snapshot_observed_at":"2026-08-02T05:12:59.576553Z","title":"Spatialthinker: Reinforcing 3d reasoning in multimodal llms via spatial rewards.arXiv preprint arXiv:2511.07403,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13454","last_updated":"2026-07-28T06:55:44Z","snapshot_observed_at":"2026-08-03T09:30:04.003236Z","submitted_at":"2026-07-15T05:27:37Z","title":"GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T05:12:59.576553Z"},"links":{"cited_paper":"/paper/2511.07403","citing_paper":"/paper/2607.13454"},"observation_digest":"sha256:5074446ea1b717fb03e39a30d62806006127cfca8423789c67687ba0eaaa8691","observation_id":"9f830fba-1192-4c41-a984-bf514729bb13","resolution":{"observed_at":"2026-08-02T05:12:59.576553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.07403","snapshot_observed_at":"2026-08-01T08:34:11.633653Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21085","last_updated":"2026-07-23T09:15:08Z","snapshot_observed_at":"2026-08-01T08:34:10.248403Z","submitted_at":"2026-07-23T09:15:08Z","title":"Geo3R: Mitigating Spatial Reasoning Hallucination in Multimodal Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T08:34:11.633653Z"},"links":{"cited_paper":"/paper/2511.07403","citing_paper":"/paper/2607.21085"},"observation_digest":"sha256:da35cebc523ccf7070ab0e3d8920961f5180ee0efc02e77fb5bb85e32ff05e3d","observation_id":"795b0743-653f-439a-b168-6fc537821dbe","resolution":{"observed_at":"2026-08-01T08:34:11.633653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.07403/citation-record","integrity":"/paper/2511.07403/integrity","json":"/paper/2511.07403/citation-record.json","paper":"/paper/2511.07403"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.13642","last_updated":"2025-03-19T05:09:14Z","snapshot_observed_at":"2026-08-05T18:02:56.273979Z","submitted_at":"2024-06-19T15:41:30Z","title":"SpatialBot: Precise Spatial Understanding with Vision Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13642","snapshot_observed_at":"2026-08-03T23:08:49.001243Z","title":"Spatialbot: Precise spatial understanding with vision language models.arXiv preprint arXiv:2406.13642,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:49.001243Z"},"links":{"cited_paper":"/paper/2406.13642","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:1d8957a5ee9264ef99458b6e0691b81adf4db36855ee5024bc202a63751c1421","observation_id":"c89204c0-a66f-433b-9146-90382ced24ee","resolution":{"observed_at":"2026-08-03T23:08:49.001243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:56.351341Z","title":"The final set consists of 50% samples from the relation category, and the remaining 50% distributed across the eight other categories","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:56.351341Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:7f678c05892c49d77e19ce9410c82d5144952ec9608a0c884b404edb60e5ac24","observation_id":"78df0953-2684-4d92-a73a-77feec1f572f","resolution":{"observed_at":"2026-08-03T23:08:56.351341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13111","last_updated":"2025-09-08T09:39:12Z","snapshot_observed_at":"2026-07-06T20:53:55.745087Z","submitted_at":"2025-03-17T12:34:22Z","title":"MM-Spatial: Exploring 3D Spatial Understanding in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13111","snapshot_observed_at":"2026-08-03T23:08:49.211667Z","title":"Mm-spatial: Exploring 3d spatial understanding in multimodal llms.arXiv preprint arXiv:2503.13111,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:49.211667Z"},"links":{"cited_paper":"/paper/2503.13111","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:6470be8e9fcc8d1b3868d6f44d235d5957ed3e562e8f4fe8e31aa9edf75c15f6","observation_id":"754c7e6f-e5aa-4259-9b5c-544b0f9bf65d","resolution":{"observed_at":"2026-08-03T23:08:49.211667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T23:08:49.319147Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:49.319147Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:ee37832877bb42916d6962d023dea5c4c14d52129232770c32424a522a063619","observation_id":"b75dce60-90e9-4b68-b252-93ff18ef8dd0","resolution":{"observed_at":"2026-08-03T23:08:49.319147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-03T23:08:49.425505Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:49.425505Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:2302d9580203c4132fef1db541949e57f81ac88da996db48b547f794e9c55b88","observation_id":"f4106c95-603e-4526-b91a-3109f8fdc443","resolution":{"observed_at":"2026-08-03T23:08:49.425505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-03T23:08:49.532620Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:49.532620Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:dd856eba975e368ed7d11d917165f4e0e63523ca6b9b9221c4d43d1faef71b3e","observation_id":"80da89b1-98fb-43e9-8400-1d37f0472ea6","resolution":{"observed_at":"2026-08-03T23:08:49.532620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:49.752446Z","title":"Xia, Ted Xiao, Jiajun Wu, Brian Ichter, Anirudha Majumdar, and Dorsa Sadigh","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:49.752446Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:41c109fad12b86fb27584b6104833473db302606a8fb05207387dba5fa19a87d","observation_id":"691282a9-ed0d-4b96-9c9b-afde5300dec0","resolution":{"observed_at":"2026-08-03T23:08:49.752446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:49.905731Z","title":"Tenenbaum, Antonio Torralba, Florian Shkurti, and Liam Paull","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:49.905731Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:dd798f9c42c5ea6620e43ebe331c2d0553a441caf590a956837a8752d50d7034","observation_id":"3ec25f26-b34a-410d-8b88-9f51e742458a","resolution":{"observed_at":"2026-08-03T23:08:49.905731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:50.006008Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:50.006008Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:9ecbf169b9c9a95d1369f1ccf01ace4bdbde6c9ccf7cb52dd0826e95809d7e2c","observation_id":"f00d6395-04a7-43f8-a724-3c149d321124","resolution":{"observed_at":"2026-08-03T23:08:50.006008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.01072","last_updated":"2020-07-02T13:02:54Z","snapshot_observed_at":"2026-08-05T08:16:27.809444Z","submitted_at":"2020-07-02T13:02:54Z","title":"Scene Graph Reasoning for Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.01072","snapshot_observed_at":"2026-08-03T23:08:50.161728Z","title":"Scene graph reasoning for visual question answering.ArXiv, abs/2007.01072,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:50.161728Z"},"links":{"cited_paper":"/paper/2007.01072","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:7ca291fcda2afd460a64a27b4111f880fbd64ea1ff3f220365a096dc3f9bd5af","observation_id":"37e990fd-39a4-40b1-a9fa-b3e215801bea","resolution":{"observed_at":"2026-08-03T23:08:50.161728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-07-06T18:48:25.120687Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-08-03T23:08:50.379903Z","title":"Tenenbaum, and Chuang Gan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:50.379903Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:d59c0e019aa82d005aafb9fddbc3881bb7c33ec5f9801ba3d4dbf8c9559c4acd","observation_id":"684ffb9a-8e32-4797-9e20-825ddc225477","resolution":{"observed_at":"2026-08-03T23:08:50.379903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:50.569283Z","title":"Visual language maps for robot navigation.2023 IEEE International Conference on Robotics and Automation (ICRA), pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:50.569283Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:476ea44161c86177e1e7c82d739883d08f34cd472b436c117ea04bee6e930fae","observation_id":"e5ed267b-4d82-460f-8344-e74390229a56","resolution":{"observed_at":"2026-08-03T23:08:50.569283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T23:08:51.090448Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:51.090448Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:3a6f62eb3b877ae9dbe7b97b3e1fc67f9349e1aa975f5e415eb5de52d66153c3","observation_id":"12199c74-cd1d-47a9-8c57-0bec1d2b0098","resolution":{"observed_at":"2026-08-03T23:08:51.090448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19785","last_updated":"2023-10-30T17:50:15Z","snapshot_observed_at":"2026-07-06T16:40:39.567420Z","submitted_at":"2023-10-30T17:50:15Z","title":"What's \"up\" with vision-language models? Investigating their struggle with spatial reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19785","snapshot_observed_at":"2026-08-03T23:08:51.252391Z","title":"What’s\" up\" with vision-language models? investigating their struggle with spatial reasoning.arXiv preprint arXiv:2310.19785,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:51.252391Z"},"links":{"cited_paper":"/paper/2310.19785","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:347e8ca231a5d61c1f0fd316872edb36d6a044c22934c2a21e18919de3c932a2","observation_id":"a74d0c71-6a7e-4dac-b709-2950e1d0698a","resolution":{"observed_at":"2026-08-03T23:08:51.252391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11537","last_updated":"2024-08-03T10:19:54Z","snapshot_observed_at":"2026-07-06T18:16:20.122022Z","submitted_at":"2024-05-19T12:56:00Z","title":"VR-GPT: Visual Language Model for Intelligent Virtual Reality Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11537","snapshot_observed_at":"2026-08-03T23:08:51.434311Z","title":"Vr-gpt: Visual language model for intelligent virtual reality applications.ArXiv, abs/2405.11537,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:51.434311Z"},"links":{"cited_paper":"/paper/2405.11537","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:ac62a5970fdf050b083a2f4d8962dca76120ed6866e2d4bfd87e9d856bc47c17","observation_id":"3b651970-7826-49d1-aa5a-51902c38b2e3","resolution":{"observed_at":"2026-08-03T23:08:51.434311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:51.695890Z","title":"Relation-r1: Progressively cognitive chain-of-thought guided reinforcement learning for unified relation comprehension","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:51.695890Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:4e05f5465c8efa730fb51266328cf0012357fbfdd8b082329871384b7a92f2c4","observation_id":"fc975e27-dd5f-468e-ae0f-9bf2ba40cd60","resolution":{"observed_at":"2026-08-03T23:08:51.695890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-03T23:08:51.834140Z","title":"Visual instruction tuning.ArXiv, abs/2304.08485,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:51.834140Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:3006d381d9a16b356b33def56dae4e299921a474e62a19ef030102c59c7eae58","observation_id":"83870d2b-27e4-4637-b5e3-c217f810ec08","resolution":{"observed_at":"2026-08-03T23:08:51.834140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-05T01:42:30.194131Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-08-03T23:08:52.041071Z","title":"Seg-zero: Reasoning-chain guided segmentation via cognitive reinforcement.ArXiv, abs/2503.06520, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:52.041071Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:994a09ede8be2feef4058994b3f7ba11b91b054f8c2307e31179f4824fb562f2","observation_id":"0747c495-7def-4a55-b911-31dd296e47ba","resolution":{"observed_at":"2026-08-03T23:08:52.041071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.05832","last_updated":"2021-04-12T21:37:18Z","snapshot_observed_at":"2026-07-06T10:58:54.293300Z","submitted_at":"2021-04-12T21:37:18Z","title":"SpartQA: : A Textual Question Answering Benchmark for Spatial Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.05832","snapshot_observed_at":"2026-08-03T23:08:52.208502Z","title":"Spartqa:: A textual question answering benchmark for spatial reasoning.arXiv preprint arXiv:2104.05832,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:52.208502Z"},"links":{"cited_paper":"/paper/2104.05832","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:32497fb65f1499b3c587d9f3de72e790a3e210c62b0fe995147a753f7f0a99c9","observation_id":"c891422c-6e37-45f5-bffc-9d02a50b97e0","resolution":{"observed_at":"2026-08-03T23:08:52.208502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20648","last_updated":"2025-04-29T11:18:38Z","snapshot_observed_at":"2026-07-06T21:16:23.106510Z","submitted_at":"2025-04-29T11:18:38Z","title":"SpaRE: Enhancing Spatial Reasoning in Vision-Language Models with Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20648","snapshot_observed_at":"2026-08-03T23:08:52.541313Z","title":"Spare: Enhancing spatial reasoning in vision-language models with synthetic data.arXiv preprint arXiv:2504.20648,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:52.541313Z"},"links":{"cited_paper":"/paper/2504.20648","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:a4029f83be1e2163d5803ede62302b3f89b63530dd28257e6e9b149cb84d94b1","observation_id":"a06ed670-65f6-48a4-991d-add349d902c4","resolution":{"observed_at":"2026-08-03T23:08:52.541313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-03T23:08:52.730617Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl.ArXiv, abs/2503.07536,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:52.730617Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:d9f6fbc33fc0b4e552922a7c5765742697de8dd4fa32b32f0c272fd345fcc3ba","observation_id":"2e759782-f9f9-4f57-9c33-1ef2fafb3c75","resolution":{"observed_at":"2026-08-03T23:08:52.730617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-03T23:08:52.900128Z","title":"Kosmos-2: Grounding multimodal large language models to the world.arXiv preprint arXiv:2306.14824,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:52.900128Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:f2ab600a089edd9c050affdba596a0d062e7d64b6b96e220aaecb67a08aa1460","observation_id":"f39ec1f3-04ff-4a4c-9c30-c8683155be63","resolution":{"observed_at":"2026-08-03T23:08:52.900128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08242","last_updated":"2023-02-16T11:49:48Z","snapshot_observed_at":"2026-08-06T16:36:50.607091Z","submitted_at":"2023-02-16T11:49:48Z","title":"Tuning computer vision models with task rewards","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08242","snapshot_observed_at":"2026-08-03T23:08:53.063278Z","title":"Tuning computer vision models with task rewards.ArXiv, abs/2302.08242,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:53.063278Z"},"links":{"cited_paper":"/paper/2302.08242","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:7ae47f1f3384557af25598fdfde553be1a6ef54aef5bee8667cbb38e19247586","observation_id":"e7353cbc-a74a-4f24-9d51-4d6adfe96c72","resolution":{"observed_at":"2026-08-03T23:08:53.063278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T23:08:53.181240Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:53.181240Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:74508fbdb5bd20d0845358d98d568d3b69cd9aea82f94dbab628039335eb7c5a","observation_id":"0b5eb21f-d1d3-4ea5-b9d0-0162255ccabd","resolution":{"observed_at":"2026-08-03T23:08:53.181240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:53.286554Z","title":"Satori-r1: Incentivizing multimodal reasoning with spatial grounding and verifiable rewards.ArXiv, abs/2505.19094, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:53.286554Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:e89613f3ce1919537199ed6aa95eded7dc811beb1d7ea05c325aff9f6d259ef9","observation_id":"45e8f9db-be2d-4c7d-aa71-c9aac05fda5d","resolution":{"observed_at":"2026-08-03T23:08:53.286554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19990","last_updated":"2025-06-20T05:50:00Z","snapshot_observed_at":"2026-07-06T20:58:36.895584Z","submitted_at":"2025-03-25T18:21:07Z","title":"LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19990","snapshot_observed_at":"2026-08-03T23:08:53.435983Z","title":"Lego-puzzles: How good are mllms at multi-step spatial reasoning? ArXiv, abs/2503.19990,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:53.435983Z"},"links":{"cited_paper":"/paper/2503.19990","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:f0b3da564787cc88c208e6d6876dd3f8e07404b985006be4427e406e90139d99","observation_id":"1b7a79e8-c0f5-47b5-9ddd-417b685a1554","resolution":{"observed_at":"2026-08-03T23:08:53.435983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-02T07:15:58.798604Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-03T23:08:53.597396Z","title":"Alex Hofer, Jan Humplik, Atil Iscen, Mithun George Jacob, Deepali Jain, Ryan C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:53.597396Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:5a3a7684151b31d7c9d476864db9e3aaf8942a4252355d05d07641b320d91374","observation_id":"18eb29e9-b2f6-43ac-bd47-c68f2c47f2f7","resolution":{"observed_at":"2026-08-03T23:08:53.597396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-03T23:08:53.784146Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:53.784146Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:43753fcff2fdd580b61bb13c9faa490846cbb873386fdfc52f100ecc5e467c14","observation_id":"3e2c0cf1-8d70-4105-b250-082a05566d2f","resolution":{"observed_at":"2026-08-03T23:08:53.784146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:53.880851Z","title":"Learning 3d semantic scene graphs from 3d indoor reconstructions.2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:53.880851Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:3a7541029d7ae57136a0fa49287ad430c85295b912b41567985e9963a3d951a0","observation_id":"184ba021-4085-4680-adac-263da207cb1b","resolution":{"observed_at":"2026-08-03T23:08:53.880851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01371","last_updated":"2025-06-02T06:58:43Z","snapshot_observed_at":"2026-07-06T21:34:48.355215Z","submitted_at":"2025-06-02T06:58:43Z","title":"SVQA-R1: Reinforcing Spatial Reasoning in MLLMs via View-Consistent Reward Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01371","snapshot_observed_at":"2026-08-03T23:08:54.014934Z","title":"Svqa-r1: Reinforcing spatial reasoning in mllms via view-consistent reward optimization.ArXiv, abs/2506.01371,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:54.014934Z"},"links":{"cited_paper":"/paper/2506.01371","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:4171be6f0cc0bac70766370de280cd2a75bb9ae06bc208e3726977a30e5749f8","observation_id":"49f1a966-d0d5-4fa1-b6ae-f49e5e29be33","resolution":{"observed_at":"2026-08-03T23:08:54.014934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00622","last_updated":"2025-04-23T04:53:40Z","snapshot_observed_at":"2026-07-06T18:23:57.071938Z","submitted_at":"2024-06-02T05:51:15Z","title":"Compositional 4D Dynamic Scenes Understanding with Physics Priors for Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00622","snapshot_observed_at":"2026-08-03T23:08:54.150077Z","title":"Compo- sitional 4d dynamic scenes understanding with physics priors for video question answering.arXiv preprint arXiv:2406.00622,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:54.150077Z"},"links":{"cited_paper":"/paper/2406.00622","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:3bdcf770b731d9ffa0a2a676122ac0a83bdf25fa8a8fddcfda7a9b2beaa65167","observation_id":"8bcb050c-f830-470d-bf5e-a9fb35ed203d","resolution":{"observed_at":"2026-08-03T23:08:54.150077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-03T23:08:54.313086Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:54.313086Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:8b5b724b44817c34eb998dfa93143d9a17b7374410b7e83428414feb1ed1424d","observation_id":"60ab87b4-c715-4fd4-a794-66a83e21b3ac","resolution":{"observed_at":"2026-08-03T23:08:54.313086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:54.436266Z","title":"V*: Guided visual search as a core mechanism in multimodal llms.2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:54.436266Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:8da5c33826d537625efcdefaac4f1a75a9d1b508060504505094e7a9669cb157","observation_id":"c3ddaedc-c736-4ea3-8d8d-1ca4bb035de5","resolution":{"observed_at":"2026-08-03T23:08:54.436266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:54.579374Z","title":"Zang, Peng Gao, Yixuan Li, and Kaiyang Zhou","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:54.579374Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:0c02da18f8fadf3ed0b94a37a54a6dbdaf8a5329ae29afa8b9000e60a911d0c5","observation_id":"eb66f52d-fd70-4f0a-8f51-9b80d47b2c4f","resolution":{"observed_at":"2026-08-03T23:08:54.579374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:54.699568Z","title":"Advancing multimodal reasoning capabilities of multimodal large language models via visual perception reward.ArXiv, abs/2506.07218,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:54.699568Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:9d41fdac190aeb39469f13e10a47411cec23e1b87dcff3f5629bbced6c468a05","observation_id":"c1e0177b-f4a2-4bee-8e91-f8ccc98bf475","resolution":{"observed_at":"2026-08-03T23:08:54.699568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14540","last_updated":"2024-04-13T01:59:06Z","snapshot_observed_at":"2026-07-06T16:36:55.519052Z","submitted_at":"2023-10-23T03:44:40Z","title":"Evaluating Spatial Understanding of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14540","snapshot_observed_at":"2026-08-03T23:08:54.820458Z","title":"Evaluating spatial understanding of large language models.arXiv preprint arXiv:2310.14540,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:54.820458Z"},"links":{"cited_paper":"/paper/2310.14540","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:6d63f5a9ce3c0c75ac5ecd48b2f05f3d5ec30ed4574b5171d91c8fb168e9fb78","observation_id":"2da96a50-0811-4637-a97e-afca4a1a2534","resolution":{"observed_at":"2026-08-03T23:08:54.820458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-03T23:08:55.096964Z","title":"Dapo: An open-source llm reinforcement learning system at scale.ArXiv, abs/2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:55.096964Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:f064af63438be5f999f7e4dbb02282383af646f1eca693064e81ad19408460ea","observation_id":"097102b2-558c-4e44-b174-d754c5e13c78","resolution":{"observed_at":"2026-08-03T23:08:55.096964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-03T23:08:55.221065Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics.ArXiv, abs/2406.10721,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:55.221065Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:166264d5500fdd3220d8bba5449974f8e98205bf6c855ac7a35ac3ee1fca9699","observation_id":"8e378c4c-a10a-4695-a5af-ca05f8850fde","resolution":{"observed_at":"2026-08-03T23:08:55.221065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13257","snapshot_observed_at":"2026-08-03T23:08:55.368717Z","title":"Mme-realworld: Could your multimodal llm challenge high-resolution real-world scenarios that are difficult for humans?ArXiv, abs/2408.13257,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:55.368717Z"},"links":{"cited_paper":"/paper/2408.13257","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:bc5d643db49f3c216dcfb370754329457b3766e9a77663422804faf3f1074b66","observation_id":"872c63a0-cae0-4106-8105-33e54e94d821","resolution":{"observed_at":"2026-08-03T23:08:55.368717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-03T23:08:55.516798Z","title":"Lla- mafactory: Unified efficient fine-tuning of 100+ language models.ArXiv, abs/2403.13372,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:55.516798Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:c9622fd3b40011171dab6d2b16a5646b41b4026b8b13fada11eb2b8ef3926572","observation_id":"741f7457-e977-48e8-906b-26677e10b43a","resolution":{"observed_at":"2026-08-03T23:08:55.516798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12345","last_updated":"2025-01-21T18:23:42Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T18:23:42Z","title":"The doubly librating Plutinos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12345","snapshot_observed_at":"2026-08-03T23:08:55.631675Z","title":"Easyr1: An efficient, scalable, multi-modality rl training framework.arXiv preprint arXiv:2501.12345,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:55.631675Z"},"links":{"cited_paper":"/paper/2501.12345","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:d2518c5689d607d231ef975876affb5c3d106ff4f6cb91b800f2258c5f76017a","observation_id":"30ad8c8b-2656-4860-81cc-30be0e6f4a53","resolution":{"observed_at":"2026-08-03T23:08:55.631675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-07-06T20:48:18.268075Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-03T23:08:55.751893Z","title":"aha moment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:55.751893Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:84e204d3999a80f35289424ccc44e10d6938dd513049686ff42836863110d15b","observation_id":"5d1af005-a726-46b2-94d0-6c2d3323fdb6","resolution":{"observed_at":"2026-08-03T23:08:55.751893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:55.911489Z","title":"Struct2d: A perception-guided framework for spatial reasoning in large multimodal models.ArXiv, abs/2506.04220,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:55.911489Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:fcf685f792056ffb679cde0c3d3fde60986bccd0902396700a25cf4ead7e0192","observation_id":"30a3f40e-dfc0-4bbe-9685-9adb8bd9b6bf","resolution":{"observed_at":"2026-08-03T23:08:55.911489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:56.091197Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:56.091197Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:801f98c23ced4f4109a2396d4369463f6809a37d6cc9a189a0bcea9d0dd57780","observation_id":"1a89eb08-1985-4207-a103-1cbe9ea12b18","resolution":{"observed_at":"2026-08-03T23:08:56.091197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:56.235392Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:56.235392Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:2935ea8219efa91493f48375396822642e28e50743a5779f6c040c39a7755c78","observation_id":"eb9456ff-e1b5-41a9-948e-44ef2f8846f9","resolution":{"observed_at":"2026-08-03T23:08:56.235392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:56.662635Z","title":"These serve as upper bounds for spatial generalization under non-public training regimes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:56.662635Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:f6b427746cdfbcd26d1bfb7a5bd22fe127f4f017447ffc1fe11d7afe24c56a34","observation_id":"5831bdf6-d86d-49f3-89c5-382b79c9af35","resolution":{"observed_at":"2026-08-03T23:08:56.662635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:56.802456Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:56.802456Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:7ada7657667eae17c6b42b0fe4992a1739f005ec3cf8f4606cb11a4bff9a93fa","observation_id":"01525c57-1a31-4dfa-85e1-b4bd8224ac02","resolution":{"observed_at":"2026-08-03T23:08:56.802456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:57.144009Z","title":null,"venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:57.144009Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:9297cbbcbb37fdc73522c61fa5aab1f325a05028020e7914f193a3a4c1aecff4","observation_id":"f535576d-f97a-44fe-b75b-e468cb08611c","resolution":{"observed_at":"2026-08-03T23:08:57.144009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:57.290068Z","title":"aha moment","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:57.290068Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:1bd73cdf4e075120879b02deb2219ff78f822845133a87201d4e55d585d1dc6f","observation_id":"004f16b0-dabe-41d0-a4de-48ae173b8d56","resolution":{"observed_at":"2026-08-03T23:08:57.290068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:57.431844Z","title":"In contrast, Huang et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:57.431844Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:8c3dd0da4bcc1cb58ffe924f879d3c3ffbed464fff11960ad01b60dbf283800f","observation_id":"392b51f9-2491-4a61-94b4-539e7c057893","resolution":{"observed_at":"2026-08-03T23:08:57.431844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:56.468585Z","title":"Training time totals around 13 hours for the 3B model and 15 hours for the 7B model","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:56.468585Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:0ff333c3faafa59983f055887363d63bf6b756484387ed1259029c9578204d4f","observation_id":"3cb75062-c408-4e15-b1be-f34b8d972534","resolution":{"observed_at":"2026-08-03T23:08:56.468585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-07-06T20:52:09.743730Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-03T23:08:54.932557Z","title":"Computational modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:54.932557Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:afd9e413da27ad445d9740932d48b3662bfa6a2554ba5651ce809b6ac3693bab","observation_id":"e4a28644-7eea-4469-ab5b-f78d4e3d5ea8","resolution":{"observed_at":"2026-08-03T23:08:54.932557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02537","last_updated":"2024-06-04T17:55:43Z","snapshot_observed_at":"2026-07-06T18:25:22.852874Z","submitted_at":"2024-06-04T17:55:43Z","title":"TopViewRS: Vision-Language Models as Top-View Spatial Reasoners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02537","snapshot_observed_at":"2026-08-03T23:08:51.560457Z","title":"Topviewrs: Vision-language models as top-view spatial reasoners.arXiv preprint arXiv:2406.02537, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:51.560457Z"},"links":{"cited_paper":"/paper/2406.02537","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:71d3784493eac6d30a5b0a87257e0ad28d5e0b2066302bdbce50cfdb40bf0d4b","observation_id":"6be8b81c-1b5a-44a9-849b-a13e185874eb","resolution":{"observed_at":"2026-08-03T23:08:51.560457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T23:08:50.963202Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:50.963202Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:df0835a17fcd1c00fd685b47914536802f97b8f655bfa4c7ae34629fd5e89ada","observation_id":"bc46fea0-5a8f-4cd9-8c99-16b686b37315","resolution":{"observed_at":"2026-08-03T23:08:50.963202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15364","last_updated":"2024-10-20T11:40:31Z","snapshot_observed_at":"2026-08-06T04:27:03.333862Z","submitted_at":"2024-10-20T11:40:31Z","title":"Scene Graph Generation with Role-Playing Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15364","snapshot_observed_at":"2026-08-03T23:08:49.079544Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:49.079544Z"},"links":{"cited_paper":"/paper/2410.15364","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:d30f88051284bbeffd8ef69b1294e83c6202dee1e215d469d275ed2bfdd0eb62","observation_id":"a184775b-87aa-4aad-b5e2-e31d00093f42","resolution":{"observed_at":"2026-08-03T23:08:49.079544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-02T06:03:03.152035Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-08-03T23:08:52.414897Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms.ArXiv, abs/2402.07872,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:52.414897Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:ee551a5aa42a0e4b9fc833fb420bcf4aeb479e34ab4cd3738079328d89663db1","observation_id":"2ace252f-c4e0-4843-b1d3-24b59dcc3d43","resolution":{"observed_at":"2026-08-03T23:08:52.414897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-07-06T20:49:27.466064Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-03T23:08:50.746629Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:50.746629Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:822f8b5af34aa7ff6093eb1eded899d01c6049e8d9ea50b72de1133e9a433494","observation_id":"850b4d05-8185-4f29-8c22-664b61f7907f","resolution":{"observed_at":"2026-08-03T23:08:50.746629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13617","last_updated":"2025-05-26T10:35:23Z","snapshot_observed_at":"2026-07-06T21:11:24.852957Z","submitted_at":"2025-04-18T10:46:22Z","title":"Compile Scene Graphs with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13617","snapshot_observed_at":"2026-08-03T23:08:49.130584Z","title":"Compile scene graphs with reinforcement learning.arXiv preprint arXiv:2504.13617, 2025c","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:49.130584Z"},"links":{"cited_paper":"/paper/2504.13617","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:01bca173f387d33aa14d205d42dbacf9110f7b7dfbd9bb360e9743fd7533bff7","observation_id":"5e1f95ee-15d3-4f39-ab9a-a06880eb7999","resolution":{"observed_at":"2026-08-03T23:08:49.130584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-07-06T20:45:32.493589Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-03T23:08:49.679221Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:49.679221Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:d7af93ce39d05863494a17f062d767e8883960d444d04de150d7ad8b44dc5d1f","observation_id":"984968e4-4ccf-46c3-bc48-db3fe18d1771","resolution":{"observed_at":"2026-08-03T23:08:49.679221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T23:08:48.929476Z","title":"Qwen2.5-vl technical report.ArXiv, abs/2502.13923,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:48.929476Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:1409c89be3e0c7bd61dc0361c08551b4ba4c8e0a6266e500031112acee64e3b5","observation_id":"bba40aad-bee4-4534-b73c-9358d4f9d998","resolution":{"observed_at":"2026-08-03T23:08:48.929476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:56.979052Z","title":"For models with spe- cific reasoning templates such as VLAA-Thinker, SpaceThinker, and SpaceOm, we utilize their corresponding structured prompts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":2048,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:56.979052Z"},"links":{"citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:a52bf13385146dcf80144a48407b5b81c30a448b6a9c1cdd37f31a02c1f4102b","observation_id":"3412f57a-a493-4f14-a5ce-f65aa372c0f5","resolution":{"observed_at":"2026-08-03T23:08:56.979052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 14 inbound Pith citation observations for arXiv:2511.07403."}