{"as_of":"2026-08-07T00:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6655fe6d15d71435fc961393f09d28371b8ecb9e94dbdcad9d30a0c0f62b09d4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:48:51.657856Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T03:06:43.700595Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-06T21:48:51.657856Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-06T21:40:57.300580Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.657856Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:0f310b8fa99cacec49b000ab1283ad9d82caa215465b3a5ef8a0b73cf9b81ad3","observation_id":"e1d998d1-f294-4f63-905f-d4b06ff9f1f6","resolution":{"observed_at":"2026-08-06T21:48:51.657856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-06T19:54:48.162766Z","title":"Spatialvlm: Endowing vision- language models with spatial reasoning capabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-06T19:47:41.467899Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.162766Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:1fa8e190c08c0bb8b911d85389fb367da12e1d3117dbeec463c56aff9a6569e9","observation_id":"e7f85b5b-2a86-40c6-b069-8646390f3e0c","resolution":{"observed_at":"2026-08-06T19:54:48.162766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-06T15:03:27.082032Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17012","last_updated":"2026-06-10T06:47:08Z","snapshot_observed_at":"2026-08-06T14:56:09.933489Z","submitted_at":"2025-07-22T20:49:25Z","title":"Sustainability assessment using multimodal AI agents","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:03:27.082032Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2507.17012"},"observation_digest":"sha256:441a8f356c41a5f76161fe34fbba2e928042e9f035fffb34209ac952021eae38","observation_id":"d56ca6d2-3da4-48fc-83ca-1c00617ec8ad","resolution":{"observed_at":"2026-08-06T15:03:27.082032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-05T11:56:07.947697Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02175","last_updated":"2025-09-04T16:38:44Z","snapshot_observed_at":"2026-08-05T11:56:06.572610Z","submitted_at":"2025-09-02T10:32:58Z","title":"Understanding Space Is Rocket Science -- Only Top Reasoning Models Can Solve Spatial Understanding Tasks","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T11:56:07.947697Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2509.02175"},"observation_digest":"sha256:2c95e4cda02ce832b2e8c4a6a745c0e78e2a0c9b143233e1c5b0392ac2744b4e","observation_id":"033b7dc6-1001-45df-ae01-844f0722ad04","resolution":{"observed_at":"2026-08-05T11:56:07.947697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2603.08096","last_updated":"2026-04-20T17:13:59Z","snapshot_observed_at":"2026-07-06T22:48:21.803560Z","submitted_at":"2026-03-09T08:37:05Z","title":"TrianguLang: Geometry-Aware Semantic Consensus for Pose-Free 3D Localization","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T15:12:23.459579Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2603.08096"},"observation_digest":"sha256:40b2c1649e852f4cc1d292d0a6bf932d7b3866d2bc9871f9223aee69ac41ee37","observation_id":"6e0d4a50-0c88-4a17-9bce-c82ec548426a","resolution":{"observed_at":"2026-05-15T15:16:09.680303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-06T10:59:04.687049Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:a0217a72ce5ad9882030b09125e4f94cb8117165f26c1fde995c678e3e9cdaa2","observation_id":"dc63545e-e5f0-43f7-a984-90ee3e098ed3","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2604.00799","last_updated":"2026-04-02T21:20:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-01T12:06:54Z","title":"Multimodal Language Models Cannot Spot Spatial Inconsistencies","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-13T23:12:27.333405Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2604.00799"},"observation_digest":"sha256:cbae72aace2b2eae260cd7d35aca2011a6292dd6395bbf1929dcad1de4b186ad","observation_id":"1f806e86-4c61-4cc9-b2f2-229ee754e391","resolution":{"observed_at":"2026-05-13T23:13:24.784848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2604.20570","last_updated":"2026-04-22T13:50:00Z","snapshot_observed_at":"2026-07-06T23:07:03.254122Z","submitted_at":"2026-04-22T13:50:00Z","title":"Exploring Spatial Intelligence from a Generative Perspective","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T00:45:46.261005Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2604.20570"},"observation_digest":"sha256:251f5c5a37edd306f03f2302a17584a661c588fb1f411af305904bf20f598508","observation_id":"4042bd62-411d-4827-a6a5-d300abfe0de5","resolution":{"observed_at":"2026-05-10T00:49:48.849225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2604.25954","last_updated":"2026-04-25T14:19:29Z","snapshot_observed_at":"2026-07-06T23:11:43.764239Z","submitted_at":"2026-04-25T14:19:29Z","title":"Fast Core Identification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T07:11:30.553696Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2604.25954"},"observation_digest":"sha256:b3170913241d683ab63aca268240ddde105f4e3a25d4ff5236966b14b9d76055","observation_id":"8115d2dd-7059-40e7-ae26-f6c89343a181","resolution":{"observed_at":"2026-05-11T21:01:14.738363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2605.01694","last_updated":"2026-05-03T03:19:42Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T03:19:42Z","title":"Latent State Design for World Models under Sufficiency Constraints","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:55:31.825583Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2605.01694"},"observation_digest":"sha256:62c5dbcf18e2991f91db5fdceb87f8b92c39878ce44bf01649e9dccd5b3681ac","observation_id":"33c744aa-d26f-4a17-a6a6-16932b24b563","resolution":{"observed_at":"2026-05-11T09:36:04.461629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2605.13169","last_updated":"2026-05-15T16:50:42Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T08:31:22Z","title":"PanoWorld: Towards Spatial Supersensing in 360$^\\circ$ Panorama World","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T20:40:59.877854Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2605.13169"},"observation_digest":"sha256:809a24a38f5997fd15ecb3ca9565c6222de32d0024afd676a629ddb2198dbba7","observation_id":"69da90aa-aaa9-48f4-b247-5247b855e41d","resolution":{"observed_at":"2026-05-14T20:42:57.776205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2605.13169","last_updated":"2026-05-15T16:50:42Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T08:31:22Z","title":"PanoWorld: Towards Spatial Supersensing in 360$^\\circ$ Panorama World","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T16:57:03.172340Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2605.13169"},"observation_digest":"sha256:55252997814940fc6c86b80b2eed00cd8d199d32d9a1b42312dfed36dc3eb514","observation_id":"23a5b44b-64c5-49ad-be51-9ce0c3695052","resolution":{"observed_at":"2026-05-19T16:57:40.149820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2606.00963","last_updated":"2026-05-31T02:36:57Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T02:36:57Z","title":"Reasmory: 3D Reconstruction as Explicit Memory for VLMs Spatial Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T17:46:21.821764Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2606.00963"},"observation_digest":"sha256:182bad106d1b49a272e64a4af806d9b7855f737e9f391c1f98261bf71ccebac8","observation_id":"b696d70e-7b11-4944-861a-72ea37bed505","resolution":{"observed_at":"2026-07-01T20:46:13.715412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2606.03240","last_updated":"2026-06-02T07:01:18Z","snapshot_observed_at":"2026-07-31T03:23:10.872093Z","submitted_at":"2026-06-02T07:01:18Z","title":"GeoAlign: Beyond Semantics with State-Guided Spatial Alignment in VLA Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T10:04:10.627420Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2606.03240"},"observation_digest":"sha256:9ebd62bea958ae44a2accd19772ea712cf0ea9fb1fae746f9c7f8fc260bd9479","observation_id":"8b054447-c513-4c7b-96e8-94c20819320c","resolution":{"observed_at":"2026-07-02T03:26:29.202939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:7367b182ad6fbfb255735adb8654c8e562a1a2c9f5f81c4858b56fa36850a849","observation_id":"c1ccb55f-fade-44c5-a941-4f5298ab4061","resolution":{"observed_at":"2026-07-02T02:36:27.141917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2606.05677","last_updated":"2026-06-04T04:00:12Z","snapshot_observed_at":"2026-08-02T16:24:06.015782Z","submitted_at":"2026-06-04T04:00:12Z","title":"LongSpace: Exploring Long-Horizon Spatial Memory from Perception to Recall in Video","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T02:16:25.730555Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2606.05677"},"observation_digest":"sha256:dfc0a368f92ff46edf5cc28898a7928ba2e210b05cb10e7ecc4b4c316b15ba43","observation_id":"19c5ae1c-b4f1-42ca-830b-a59f7df338e2","resolution":{"observed_at":"2026-07-02T12:16:57.214345Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2606.05833","last_updated":"2026-06-18T15:40:37Z","snapshot_observed_at":"2026-08-03T07:19:30.958860Z","submitted_at":"2026-06-04T08:11:12Z","title":"Learning Geometric Representations from Videos for Spatial Intelligent Multimodal Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T02:13:53.219095Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2606.05833"},"observation_digest":"sha256:e68aed705359a3e1f4932cdc49bf0b97ac6a5cbd8aacff5c6d53d737a3691898","observation_id":"63d4cc74-765a-4972-8a29-1c166fdb8eb9","resolution":{"observed_at":"2026-07-02T12:16:57.509150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2606.17539","last_updated":"2026-06-16T05:32:39Z","snapshot_observed_at":"2026-07-06T23:53:07.149182Z","submitted_at":"2026-06-16T05:32:39Z","title":"Reinforcing Dual-Path Reasoning in Spatial Vision Language Models","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-06-27T01:42:30.005911Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2606.17539"},"observation_digest":"sha256:d41a3eb4617d7aee2688041fb741951eeed294ba88e714311b248fa05aa6d755","observation_id":"e2c309cb-eb6c-44c3-bca1-bf0e98e3f9da","resolution":{"observed_at":"2026-07-03T20:08:55.661477Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2606.23565","last_updated":"2026-06-22T16:31:48Z","snapshot_observed_at":"2026-08-03T00:44:37.135935Z","submitted_at":"2026-06-22T16:31:48Z","title":"HoloAgent-0: A Unified Embodied Agent Framework with 3D Spatial Memory","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T08:27:15.889885Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2606.23565"},"observation_digest":"sha256:ab38aee37e3283ae4545d06e3ee5ad6899c1351989303c8552055629222efa74","observation_id":"71a61b51-b882-40bd-952c-b3fcc22ebe5f","resolution":{"observed_at":"2026-07-04T10:49:46.492839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2606.31200","last_updated":"2026-06-30T06:30:22Z","snapshot_observed_at":"2026-08-03T09:52:50.111126Z","submitted_at":"2026-06-30T06:30:22Z","title":"Agentic RAG-VLM: Affordance-Aware Retrieval-Augmented Generation with Self-Reflective Planning for Robotic Grasping","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T06:01:37.880943Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2606.31200"},"observation_digest":"sha256:17e7a0e98c97b9b2ba4bc5a41fa1917519a303b74291b88e41b4be3d70dde2c0","observation_id":"abacc9ee-aef9-4d82-8fd3-78487bc291c6","resolution":{"observed_at":"2026-07-01T09:55:41.219848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2607.08724","last_updated":"2026-07-09T17:30:49Z","snapshot_observed_at":"2026-08-05T03:35:49.427704Z","submitted_at":"2026-07-09T17:30:49Z","title":"Latent Memory Palace: Reasoning for Control as Autoregressive Variational Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T02:59:21.353359Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2607.08724"},"observation_digest":"sha256:4371fe09f90c67fdf9e65d5e55e733cf62a9e1021b2f23c9e52a53f4c4b31725","observation_id":"6861a3c7-0b02-429d-b5b7-34abebf4b381","resolution":{"observed_at":"2026-07-10T03:06:43.701881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-31T07:19:14.164642Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24707","last_updated":"2026-07-27T17:46:43Z","snapshot_observed_at":"2026-08-04T19:59:12.791082Z","submitted_at":"2026-07-27T17:46:43Z","title":"ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T07:19:14.164642Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2607.24707"},"observation_digest":"sha256:ce2c969ad4015d6c9ff43387fb8753328460a9633e17edf73086edb32472817b","observation_id":"e5a2891b-07d2-407c-b3a2-24b431e394d9","resolution":{"observed_at":"2026-07-31T07:19:14.164642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-06T18:44:50.379910Z","title":"arXiv preprint arXiv:2401.12168 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04698","last_updated":"2026-08-05T11:07:22Z","snapshot_observed_at":"2026-08-06T23:57:15.171087Z","submitted_at":"2026-08-05T11:07:22Z","title":"Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-06T18:44:50.379910Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2608.04698"},"observation_digest":"sha256:736caa86c2dad09be0702b2c615a7c9337f0d6dd116ffa818e35817c024d9c23","observation_id":"c5f835b9-a579-4434-bb92-bb0e2de903a8","resolution":{"observed_at":"2026-08-06T18:44:50.379910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.12168/citation-record","integrity":"/paper/2401.12168/integrity","json":"/paper/2401.12168/citation-record.json","paper":"/paper/2401.12168"},"outbound":[],"paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2401.12168."}