{"as_of":"2026-08-06T20:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e24c20fc8137d95ee3570718430d9ecd712f83496bf3c20975626a763b07581c","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T10:48:24.523702Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.03577/citation-record","integrity":"/paper/2606.03577/integrity","json":"/paper/2606.03577/citation-record.json","paper":"/paper/2606.03577"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:ad32661cd3818bd73dd3e3f1c644d1e15d5e29f3c8d33187550a3eb9da5bbf74","observation_id":"6ae4d19d-96f5-4256-b781-81c3a4e02458","resolution":{"observed_at":"2026-07-02T02:36:27.073648Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:8ee2c90d81dc963815e9b1cad14a82b6ac9d1b085c701728185a114fde4f6c00","observation_id":"1dd6f1b6-e6fe-47e5-9ccf-1113c2729634","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Hot3d: Hand and object tracking in 3d from egocentric multi-view videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:86e655a04d09384aa54b377dc895f08dfdbe4837526b7180cb9e4faac38372cb","observation_id":"89364235-0444-4515-8ee0-27aaf8e1c766","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Graph-cut ransac","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:4c479dda12c3bf960cce6d33867154224a5d5ddb5cb4020069a9c85490dd8f48","observation_id":"0813fcfc-354e-457d-b509-a2387b0d01c6","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Magsac: marginalizing sample consensus","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:40ae11f1fe227304eda6756140df08b56fac4c2cba4a23a3cf86dacbec31abda","observation_id":"eee1b83d-cb4c-4b6e-a8e0-51f5e45fa590","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Surf: Speeded up robust features","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:02458fe08dc6b0434ce5e4eb134f2a168c3d772f0c28f1cfb52eb01d8369b8f6","observation_id":"68a30c06-a3af-4a02-ab5a-95bffb1f5cee","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02073","last_updated":"2025-04-21T12:09:08Z","snapshot_observed_at":"2026-08-02T06:32:26.688405Z","submitted_at":"2024-10-02T22:42:20Z","title":"Depth Pro: Sharp Monocular Metric Depth in Less Than a Second","version":2},"cited_work":{"arxiv_id":"2410.02073","doi":"10.48550/arxiv.2410.02073","metadata_source":"pith","pith_arxiv_id":"2410.02073","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Depth Pro: Sharp Monocular Metric Depth in Less Than a Second","venue":"cs.CV","work_id":"0b67883b-1901-45f1-9d58-1ef7a928df23","year":2024},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2410.02073","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:9ab8c0bed5ecda68c458f36cd30907ec38f256a4e8a56b9e9eb8a8c33d6c3d91","observation_id":"e44bacd5-5e46-41ba-9e82-6a274be1912b","resolution":{"observed_at":"2026-07-02T02:36:27.111959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Assignment problems: revised reprint","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:077449266e606a520df882d831d64732fa0a8905c3a19943f0a9e11c467a6daa","observation_id":"a6f9749d-9730-47c1-b5c4-d20f0c48171c","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:7367b182ad6fbfb255735adb8654c8e562a1a2c9f5f81c4858b56fa36850a849","observation_id":"c1ccb55f-fade-44c5-a941-4f5298ab4061","resolution":{"observed_at":"2026-07-02T02:36:27.141917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Are we on the right way for evaluating large vision-language models?Advances in Neural Informa- tion Processing Systems, 37:27056–27087, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:a62204b73a34ac80089c9c3fa0b8bb701120049fc7cfeaead0d1623ce45686af","observation_id":"705572a1-80de-4b2a-b8c0-5aee124588c2","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:6997f83ce5fe92abf94900767711bfc6d4db1583e0cb2037ff3b734876193949","observation_id":"dfa49c86-523a-47ed-90ed-71d5b80d8d96","resolution":{"observed_at":"2026-07-02T02:36:27.084858Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:07.858539+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:07.858539+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:8e45aeb23c833f7e9f7e40ae574b053eb63f916de662e0eef6e5ef4e7cdc521e","observation_id":"a01720ff-a0bd-4111-bf13-23da3c5b1999","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Superpoint: Self-supervised interest point detection and description","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:999f28b28894cf0c98fd33b102f65cad78ad4e7bec0fbf711f88ffd2fdf65089","observation_id":"63ef0228-c17b-4df3-8f59-d5de49d22778","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11907","last_updated":"2025-05-17T08:48:40Z","snapshot_observed_at":"2026-08-05T22:38:00.471791Z","submitted_at":"2025-05-17T08:48:40Z","title":"Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?","version":1},"cited_work":{"arxiv_id":"2505.11907","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.11907","snapshot_observed_at":"2026-07-08T14:44:59.676019Z","title":"Are multimodal large language models ready for omnidirectional spatial reasoning?","venue":"cs.CV","work_id":"b156a60f-0c3b-47a2-95c3-b61adfc9ee38","year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2505.11907","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:9c2a4ee3730995cfb5cf232c9feb7d6faf042abf3281020c29f52696984e8c26","observation_id":"77cc1285-2155-41fa-9d5e-fe6602069f07","resolution":{"observed_at":"2026-07-02T02:36:27.097894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"D2-net: A trainable cnn for joint detection and description of local features","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:cde3082d579f27b38dcc2b530d7fb5811d52fc8a058e16522fed8f93b5ab68f1","observation_id":"e7a02385-b46b-42b8-ac01-8abcbc39fb28","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Random sample consensus: a paradigm for model fitting with applications to image analysis and automated cartography.Communications of the ACM, 24(6):381–395, 1981","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:d86dc55bb19c581b65440a5550f3ab18398be6b9c40f2c1e0b6ea069bffb4b85","observation_id":"0722f048-ecc0-4eba-840d-a46b94ed7f30","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"A graduated assignment algorithm for graph matching.IEEE Transactions on pattern analysis and machine intelligence, 18(4):377–388, 2002","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:5e3ac80bba20adafd58b0b82b7edbe1c26ecd6a8e67b3ce3a1ca16b052bdffcd","observation_id":"5d928d06-39c7-4997-89f6-e414c19740b3","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Deepseek-r1 incentivizes reasoning in llms through reinforcement learning.Nature, 645(8081):633– 638, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:9d11b33490dc00cfc1ca5db2cca32a89d9eceaa41b4cafb6cd07f78be5710ef4","observation_id":"7757d196-dabc-4a43-a121-62e6d5dbe551","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Projective reconstruction and invariants from multiple images.IEEE Transactions on Pattern Analy- sis and Machine Intelligence, 16(10):1036–1041, 1994","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:bdf2eee687c721421b22858e83b3e2d7905da3e045326aeb48ed976bd26b8e47","observation_id":"cb58b551-ce95-4bd7-8481-5b8e60218292","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Metric3d v2: A versatile monocular geomet- ric foundation model for zero-shot metric depth and surface normal estimation.IEEE TPAMI, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:98cd49fe6cc764bf668f20e72bdc5bf1881c9d064dd6a6ea5957ab4e1bb589ad","observation_id":"401c8c08-c5ba-4db5-afb7-0b9f285f3002","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03895","last_updated":"2026-05-11T17:14:31Z","snapshot_observed_at":"2026-07-30T02:16:56.091370Z","submitted_at":"2025-10-04T18:26:55Z","title":"NoTVLA: Semantics-Preserving Robot Adaptation via Narrative Action Interfaces","version":2},"cited_work":{"arxiv_id":"2510.03895","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.03895","snapshot_observed_at":"2026-07-02T02:36:27.128521Z","title":"Notvla: Narrowing of dense action trajecto- ries for generalizable robot manipulation","venue":"cs.RO","work_id":"0764554a-bb1c-4e06-95c6-90550fc2d6b6","year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2510.03895","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:44d09551d5c42c698936fbbdf460f4cf2bec7e263c20764002a82a632b8350b8","observation_id":"026976d1-559f-4146-a53f-a64a23478789","resolution":{"observed_at":"2026-07-02T02:36:27.129942Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21257","last_updated":"2025-03-25T05:46:03Z","snapshot_observed_at":"2026-07-06T20:44:31.199648Z","submitted_at":"2025-02-28T17:30:39Z","title":"RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete","version":2},"cited_work":{"arxiv_id":"2502.21257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.21257","snapshot_observed_at":"2026-07-04T10:39:45.381569Z","title":"Robobrain: A unified brain model for robotic manipulation from abstract to concrete","venue":null,"work_id":"80a52809-7280-487f-875b-4ced1c97fd0f","year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2502.21257","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:774c7462423ca7e4a83d55c647b0160d08e05739d54a52fa485288ebb2ea4039","observation_id":"1954a7c0-0776-4997-9ddc-a72de2a85f7f","resolution":{"observed_at":"2026-07-02T02:36:27.070919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.03135","doi":"10.48550/arxiv.2506.03135","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omnispatial: Towards comprehensive spatial reasoning benchmark for vision language models","venue":"Open MIND","work_id":"f971b57a-47ff-414d-80f9-50ccac0c8e78","year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:18f1eb61a75b09c8090b2035f6837575184115c7544bddeb3d1eaadd56a837d4","observation_id":"ddfa18ac-5c9e-4185-934d-a56d26e986bc","resolution":{"observed_at":"2026-07-02T02:36:27.076549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.01587","last_updated":"2021-02-11T13:50:17Z","snapshot_observed_at":"2026-08-04T07:35:14.503040Z","submitted_at":"2020-03-03T15:20:57Z","title":"Image Matching across Wide Baselines: From Paper to Practice","version":5},"cited_work":{"arxiv_id":"2003.01587","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2003.01587","snapshot_observed_at":"2026-07-02T02:36:27.077839Z","title":"Image matching across wide baselines: From paper to practice","venue":null,"work_id":"99e9cba8-90a4-4c1e-a0d4-42742c538e8d","year":2003},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2003.01587","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:e419c25e2292089cf23683aa06a408b8e729222049346721104edbb90fd7365c","observation_id":"642fa5f6-ee6a-487c-8480-dda05b518f07","resolution":{"observed_at":"2026-07-02T02:36:27.079352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:db1151536207636e9e6c519a20310e26284d7ccafc688c9822ea4b5f1ef1709b","observation_id":"a9628a8c-e701-4de6-af9f-848344b9c5b5","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Building and better understanding vision- language models: Insights and future directions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:bed6d5e7aa46fae53de0b022c684fc25f7aed8fa6a0fbafe0ef3af430c5fe26a","observation_id":"98f32c98-ebb9-4537-ab21-6110ca5c192a","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Dl3dv-10k: A large-scale scene dataset for deep learning-based 3d vision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:51be981cb9080663ad0245dbc28d5615100e6cd9fa59137d714a7504eae262d5","observation_id":"5485ff7a-a715-453b-91e4-b0e02c70a3fe","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:cfc5ac071f01a990f929bfb055365d01b93346eefca6efec34db60b5a494278a","observation_id":"18bf7330-5e3a-4580-80fb-41f7438dcda9","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Zhang, Natalia Neverova, Andrea Vedaldi, Roman Shapovalov, and David Novotny","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:3cf644a60713cdb8c5c8f4395adde201c0429204bad280f01341e2c00b94054f","observation_id":"f18e4c8c-ca52-4718-bf4d-3d50251454ed","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:0bdc06771db88219878591068e9042bedbac56f67c455672f80e27ab4fa9d8bc","observation_id":"99dd230c-41ca-493d-b93b-3c4b252498d2","resolution":{"observed_at":"2026-07-02T02:36:27.132415Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Distinctive image features from scale- invariant keypoints.International journal of computer vi- sion, 60(2):91–110, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:aa0769a346117c0c8b6dc7b20b2c2c8074c9856ba1d0e63d678c249297ff5d14","observation_id":"bb3d0ad6-5e7a-4760-9381-041ac7f3081d","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"3dsrbench: A comprehensive 3d spatial reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:35b3f0adad1c0b63f699f729f1a1737ec552514839d8d06a2d204eb03faf6e1a","observation_id":"f067a1f9-4463-4d8a-ac2c-ab2324be276d","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Working hard to know your neighbor’s mar- gins: Local descriptor learning loss","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:1c372963e5769d35ca003d3b76eaf873222c575881de2433c6e76bcc31a01a23","observation_id":"6da8823c-ec06-40dc-ab08-1ad93192093b","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:579c0211a108ce2ea4a3a917760aacb6f7c823a1fb2e5f920beadf4165ad3bba","observation_id":"34f60a06-49f0-4d99-8083-1ca572070ed0","resolution":{"observed_at":"2026-07-02T02:36:27.122127Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Hello gpt-4o.OpenAI Blog, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:246de710d291b5d63b0d5d502ff8b837fd805ab11c8c065000a1c3e5cef109d4","observation_id":"14e5a29d-44af-473e-891f-14b87e8ecdef","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Manivideo: Generating hand-object manipulation video with dexterous and generalizable grasping","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:8f636b2bf723f2dff1dcee32b110b10302d5ef8d47bd787d53f0df58abd55be3","observation_id":"c3d48be2-94b0-4323-9ee4-e0545ddd7090","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Wide baseline stereo matching","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:0dfdf2ad7e3ce95d240afa72b53291c084c5f7640d187f368f35610a0d3becaa","observation_id":"b0820559-58e6-425a-9fe4-bb31a18f40bd","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.07755","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:02.649286Z","title":"Sat: Spa- tial aptitude training for multimodal language models","venue":null,"work_id":"bbf5f212-8e91-4bac-9e1c-ba1d133bfc4c","year":2024},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:6bff02879e0646ad6cc8b061a7acdcffe6105ed54ed24f6e74f6c2b0f185ab1d","observation_id":"d011b345-3398-475d-b9ab-fe9955d2186b","resolution":{"observed_at":"2026-07-02T02:36:27.124633Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Com- mon objects in 3d: Large-scale learning and evaluation of real-life 3d category reconstruction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:f42e1ddbd937d44bd19e837a2e5a1de79ac0bf523490d18c308edcce10a6856e","observation_id":"496f5e75-c002-42fa-8b79-0ce887b55b4f","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.06195","last_updated":"2019-06-17T16:07:03Z","snapshot_observed_at":"2026-08-05T09:15:33.123319Z","submitted_at":"2019-06-14T13:30:40Z","title":"R2D2: Repeatable and Reliable Detector and Descriptor","version":2},"cited_work":{"arxiv_id":"1906.06195","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.06195","snapshot_observed_at":"2026-07-02T02:36:27.111032Z","title":"R2D2: Repeatable and Reliable Detector and Descriptor","venue":"cs.CV","work_id":"82dc00d4-586f-48dd-a109-4d762898b61f","year":2019},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/1906.06195","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:ce8f2df3acb09fdcf8d188c510e1f9e077cec843900a6a50e07469f4cb4fcb77","observation_id":"8b3afa1c-4231-4cf3-957e-ea354cfcd599","resolution":{"observed_at":"2026-07-02T02:36:27.112698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Orb: An efficient alternative to sift or surf","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:15d997e3ac7e3170e83876898af571d86fb1441c598b776522bad7e4408460b0","observation_id":"bd27d2d4-6512-48e6-b00a-63197ea4a73f","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"PhD thesis, INRIA, 1995","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:083d03ebe8cfe3e57bde51feee13a763f281e7c6db95b52a24b2152c416b37fb","observation_id":"ab807407-ee27-4dbd-914f-2bb57f1c882b","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Structure- from-motion revisited","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:cbe54676348e17051f49a1d4458fb1b416a636a69297f94da18662025419a452","observation_id":"f5744ddd-cfb1-4fe1-adad-be546c13c85f","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Robospatial: Teaching spatial understanding to 2d and 3d vision-language models for robotics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:f9b48672012f6cce62823b3613ad6e2e8621916c0ab4785f8a62c75f74537eff","observation_id":"312c2b02-444a-400b-b41a-3549b832ddb6","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:feefda04ff0f6d78c092c0e6068813a16005ca72deaabd59ab02c1c864f1e6a4","observation_id":"ba3719b2-0304-4446-a01f-f0336982a128","resolution":{"observed_at":"2026-07-02T02:36:27.118161Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Sosnet: Second order similarity reg- ularization for local descriptor learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:0dda2489ddf9163fb012a15aab6253a1aa69b42579d4b47f6c3a05320807a02a","observation_id":"f9cc5f5f-bdb1-4b91-a9c8-5fdde233f377","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Vggt: Vi- sual geometry grounded transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:671f5276487cb8e7df09f202fc91044f7a9e6c91f0237dd69609bd52cb6957f1","observation_id":"af5fd0af-da59-447c-8ac7-9698c2996a0b","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:d5768be3ca5b826853443d0315b19fd48f977642cb8ab47bd88337b355f1c7a2","observation_id":"0368829d-6d55-416b-9f5a-7e427061e7e6","resolution":{"observed_at":"2026-07-02T02:36:27.120626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Moge: Unlocking accurate monocular geometry estimation for open-domain images with optimal training supervision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:d03633973f7c8410517aa40d3ff33ccdc35a54493913510e5d514e7fbca6ab57","observation_id":"5654e44d-c9f7-4a85-8f9f-86b073678946","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.05456","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:36:27.125785Z","title":"Site: towards spatial intelligence thorough evaluation.arXiv preprint arXiv:2505.05456,","venue":null,"work_id":"1abadf3b-d4fe-4b19-9de6-932206f949fb","year":null},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:a79368d98d5902d197a54b56a50b6f4fb8a1055668ea22e21fdd619e4916aaab","observation_id":"5c1a49a8-7ee5-4981-986b-325be80844d1","resolution":{"observed_at":"2026-07-02T02:36:27.127268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:94569d6525594aa019dee7b257c25dec50a8c1546bbea7e719ec2df705156e0a","observation_id":"e4db9203-f400-4198-ba53-7fb855936f39","resolution":{"observed_at":"2026-07-02T02:36:27.134981Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"V?: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:5bb7e03a8f3ffb7b56dac9706dceb5b9b232508ec2dabdbacef458eef33e8333","observation_id":"cca67599-480f-462f-8ab7-ef016ee9b372","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Realworldqa: Real-world visual question answering benchmark.https://x.ai/news/grok-1.5v, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:c890b576ef9c035c787f21bc6b78687e033a7e7fcbd0ad3102cf57acc2a0bd5a","observation_id":"8eca3dc7-f60e-4af2-8538-1d3eb5a1c9ea","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17015","last_updated":"2026-05-22T13:26:59Z","snapshot_observed_at":"2026-08-02T12:28:29.672279Z","submitted_at":"2025-05-22T17:59:39Z","title":"Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":"2505.17015","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17015","snapshot_observed_at":"2026-07-02T14:17:02.443466Z","title":"Multi-spatialmllm: Multi-frame spatial understanding with multi-modal large language models","venue":"cs.CV","work_id":"ae2ef343-40c0-4828-9efe-e404f5c28b36","year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2505.17015","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:ee74083bb081a6e2838a3ff04672c065e74fbf5144e99af9ddb5e9c46c0c5810","observation_id":"799da79a-0794-4675-b979-ba254ab09e3c","resolution":{"observed_at":"2026-07-02T02:36:27.138259Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Thinking in space: How mul- timodal large language models see, remember, and recall spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:ac7284411b0d40118010a9da45966fbded8e5cbb110fe72bdf93818ca3bda86f","observation_id":"f1317aff-d042-47fd-a45f-484f16b20782","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15280","last_updated":"2025-04-27T00:11:00Z","snapshot_observed_at":"2026-07-06T21:12:37.115803Z","submitted_at":"2025-04-21T17:59:53Z","title":"Seeing from Another Perspective: Evaluating Multi-View Understanding in MLLMs","version":2},"cited_work":{"arxiv_id":"2504.15280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15280","snapshot_observed_at":"2026-07-04T21:00:08.852868Z","title":"Seeing from another perspective: Evaluating multi-view understanding in mllms","venue":null,"work_id":"4411807c-24cb-49e0-a821-eac51976375f","year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2504.15280","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:671868e782fc57a203eb4b07fa503f3970241fa24e0623b4e824318c2a6699ed","observation_id":"ca1804b6-e976-403b-b10d-efdc7dd932ac","resolution":{"observed_at":"2026-07-02T02:36:27.114650Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.21458","doi":"10.48550/arxiv.2506.21458","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa- tial mental modeling from limited views","venue":"arXiv (Cornell University)","work_id":"e7da71d2-40fb-4670-9c50-b37e7469d519","year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:da78d1404fafbce57c514cd5a3252c4c8e18ed515970c031b947c5508aceaa3e","observation_id":"3abb23f5-eb12-4e73-9339-8c2afe4e338e","resolution":{"observed_at":"2026-07-02T02:36:27.109497Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Lmms- eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:7cd7b349e882cc0b6cf4bc9c3703f670691e148a68be521273239def0e440c83","observation_id":"cafdc826-d6d9-48dd-ad2e-719f58afb9cb","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:34e8877b2b7456711e1471bf4b717501f484f0781de330741e72cb11a071ebb1","observation_id":"b6d39ebf-6efe-4444-ae15-8c6ff73527a1","resolution":{"observed_at":"2026-07-02T02:36:27.103532Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"cited_work":{"arxiv_id":"2408.13257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.13257","snapshot_observed_at":"2026-07-08T06:34:41.869562Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","venue":"cs.CV","work_id":"140d79fb-a3d2-4af2-a436-9d997c171f61","year":2024},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2408.13257","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:fb70cf448962d9fe2921793493d6a237d88853232c6e19594643d3e76aaa3b92","observation_id":"9ab7348e-9927-4180-ab56-fee3d6ea73df","resolution":{"observed_at":"2026-07-02T02:36:27.094847Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-07-06T21:30:46.863005Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"cited_work":{"arxiv_id":"2505.20256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20256","snapshot_observed_at":"2026-07-02T17:27:15.771664Z","title":"Omni-r1: Reinforcement learning for omnimodal reasoning via two-system collaboration","venue":null,"work_id":"a2e58306-197a-4163-90e2-17af266cba24","year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2505.20256","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:8d6ebe75ec8e031a982cdccacd41bace9647358566949876453c922991a4c91f","observation_id":"59631231-82f1-48ef-91b3-68a6c3106ccb","resolution":{"observed_at":"2026-07-02T02:36:27.106597Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.04308","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:30:08.026359Z","title":"RoboRefer: Towards spatial referring with rea- soning in vision-language models for robotics","venue":null,"work_id":"fda95042-555b-4a64-9d35-7978eb50b269","year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:b2b1cb376779015f980197ce28fe7a0f164daf339ace7d87c9408ad743fd9f61","observation_id":"7de3e548-9bd1-463c-9c85-c1f7e271e6a2","resolution":{"observed_at":"2026-07-02T02:36:27.091415Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Stereo magnification: learning view synthesis using multiplane images.ACM Transactions on Graphics (TOG), 37(4):1–12, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:6de534f56a52e39888306bc5564a989f881f9dfc0b439ccef85f8bb897d62e83","observation_id":"b2c6241f-bb69-42d8-bf3e-1dfea16b0a79","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:73661a83cd60e27e884110464681d1d29155c806b58a2fb32503438d2b70637f","observation_id":"5418be54-f9b9-48a6-8f34-7ddef12584e9","resolution":{"observed_at":"2026-07-02T02:36:27.090117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Sega- gent: Exploring pixel understanding capabilities in mllms by imitating human annotator trajectories","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:05d4ce8d9a477a4490b4e904ec47828163e48988a9ae8e5f71f4faf279d77c1d","observation_id":"44fc81a2-c9dd-4d62-b898-e68c27f24fca","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21457","last_updated":"2026-06-08T14:20:16Z","snapshot_observed_at":"2026-07-06T21:31:35.572708Z","submitted_at":"2025-05-27T17:29:31Z","title":"ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.21457","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21457","snapshot_observed_at":"2026-07-04T16:29:57.224762Z","title":"arXiv preprint arXiv:2505.21457 , year =","venue":"cs.CV","work_id":"2f6b9068-7d97-4dae-b9fb-d9c4acb49d40","year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2505.21457","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:7064d91689fe29254ba7393acb6479f2ebc2a48655b65e202ae68f4acdeacabb","observation_id":"16f9fb93-a9d2-48ee-a297-28f0690b62cd","resolution":{"observed_at":"2026-07-02T02:36:27.100708Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"7 – Implementation Details:Complete specifi- cations of data generation pipeline, experimental setup, prompt template, and curriculum progression schedules","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:562e6cdc27b960d769f1e2de23519ad9a620f56ea15c4f5d588eb4ec03569504","observation_id":"1750721d-d4f7-405a-8af5-46f9d6fc334d","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:7c597f264a2523725cf5ce6b245b6dde52cb17e7db30dcb8609bc993aca6e700","observation_id":"bb318602-0cdf-4692-8b4a-01ddb380f6b1","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"Supervised Fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:14b3bebbfef0df89ddceb7b7ef61f69d482a51ed99d3e8e3022570863833122f","observation_id":"6132f501-f417-4ee5-9729-7154c0949599","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"None” (F5).ReasonMatch-Bench includes regions that legitimately have no correspondence in the other view. F5 measures whether the model uses the “none","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:d8f21ec5ba7bf3d09eedd75ddd5b0d53337d8922355da73002d50cb461e33585","observation_id":"8e7103c3-9d8d-46d9-9624-e453095fb1d1","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:48:24.523702Z","title":"1\": \"1\",","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:01a5845489b210fe388b91064a187b9a7074a2ff31315f9740d8b0f02c04f6bc","observation_id":"b4e87068-946b-4661-84d3-50b28635c487","resolution":{"observed_at":"2026-06-28T10:48:24.523702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":44,"verified_exact":24,"verified_fuzzy":0},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2606.03577."}