{"as_of":"2026-08-13T05:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:543ef45be63817fbb08803258e18e0f9c4f170a390a923dbcc765e2d10360be0","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:33:29.808181Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.10864/citation-record","integrity":"/paper/2608.10864/integrity","json":"/paper/2608.10864/citation-record.json","paper":"/paper/2608.10864"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-12T15:33:27.118241Z","title":"Vlm-3r: Vision-language models augmented with instruction-aligned 3d reconstruction.arXiv preprint arXiv:2505.20279, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.118241Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:de1146dc8d7f688f3f5a136b9c90e020ba086169bb1db3f0eddd139d17ac95f6","observation_id":"54a1a48e-541c-4a26-99a9-ac63c5153957","resolution":{"observed_at":"2026-08-12T15:33:27.118241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.168523Z","title":"3drs: Mllms need 3d-aware representation supervision for scene understanding.Advances in Neural Information Processing Systems, 38: 67961–67988, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.168523Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:1735474dc705d4e4eeaa30a89aa20d14bc32e2146112fb0babb23053ad1902f2","observation_id":"1f84e78f-dfcc-4e6e-8447-694e34bbad57","resolution":{"observed_at":"2026-08-12T15:33:27.168523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.208043Z","title":"CUP Archive, 1967","venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.208043Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:d244697e78464853eafa4036cf2637501310a080e5a9f35bb3c6df8d11eaf4e2","observation_id":"72786601-5a8c-4972-bbd3-73db14d1f467","resolution":{"observed_at":"2026-08-12T15:33:27.208043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.952237Z","title":"Henry Holt and Co., Inc., New York, NY , USA, 1982","venue":null,"work_id":"3828e70f-f52a-404f-bc98-e6afc8455f0d","year":1982},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.258250Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:eca16606312f1222bec07da20fd9612c6c242597b337221ae51989d2ef965e8e","observation_id":"bb9cd8f1-1932-4808-9c04-adda660b79d2","resolution":{"observed_at":"2026-08-12T15:33:32.032179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.296641Z","title":"Number 6","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.296641Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:612badaf3404d264c597d4d481499a547fba694775657c1c342c684e72ab2f96","observation_id":"8b75e6f2-0426-4b6a-847d-ff22eaf69d19","resolution":{"observed_at":"2026-08-12T15:33:27.296641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.334241Z","title":"Separate visual pathways for perception and action","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.334241Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:e9c84f8d39e9d9071ee0aeedbeb0a00fc46b2f174322bd83c9b6a55e6ba3bd87","observation_id":"9c1485a0-d1ed-4f5d-898d-49463389cea6","resolution":{"observed_at":"2026-08-12T15:33:27.334241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.374416Z","title":"Mental rotation of three-dimensional objects.Science, 171(3972):701–703, 1971","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.374416Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:8735c61963063cb9559a6b86e2af4a52482a2545516f1217a719490912321374","observation_id":"c70e74d4-ee1f-4bb0-a477-e732b8540558","resolution":{"observed_at":"2026-08-12T15:33:27.374416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.403655Z","title":"Oxford university press, 1978","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.403655Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:d6bf430ce5277f68834e0f56641310f7394912ebd2279a482af6916cf319e909","observation_id":"53fa584c-0db6-46e2-a28b-fd03061b08d9","resolution":{"observed_at":"2026-08-12T15:33:27.403655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.434416Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.434416Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:a69b9c9ec9ee0ea1674de523154ebe3c52e3e763f3028c6ca24215038f246441","observation_id":"3d47e3f0-36cc-4b90-b178-965802fae45f","resolution":{"observed_at":"2026-08-12T15:33:27.434416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-12T15:33:27.467684Z","title":"Rt-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.467684Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:c81afd8e72a830a2a6103df06cafa9d22982a4f6743dd31f7b0a5cee2f3c89ce","observation_id":"04ee055b-8d94-4616-9a27-fa3eac91f6a3","resolution":{"observed_at":"2026-08-12T15:33:27.467684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-12T15:33:27.488894Z","title":"Palm-e: An embodied multimodal language model.arXiv preprint arXiv:2303.03378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.488894Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:51a623863c98d576a095455093f9dd8a92728c4460a61fd931a62485c5503823","observation_id":"c274fcc8-ac9b-4312-b3d0-4d118e2a2623","resolution":{"observed_at":"2026-08-12T15:33:27.488894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.513243Z","title":"Open x- embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.513243Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:b3ed587959830d971824fde3b53c076d1749c0b993c2ad611ea9d959dbca7df8","observation_id":"f4020c15-82c7-4b85-b0ef-3ff96bf5ab12","resolution":{"observed_at":"2026-08-12T15:33:27.513243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.536117Z","title":"Are vlms ready for autonomous driving? an empirical study from the reliability, data and metric perspectives","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.536117Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:927085fe14d2859f909dfd52b91eb192477c4b340c6e4e0a0218d45911b7345d","observation_id":"ecd75291-ac67-40ae-9e16-39afc05ac79f","resolution":{"observed_at":"2026-08-12T15:33:27.536117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-12T15:33:27.559154Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.559154Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:08dfd76b33c71506e96004249283ca4968890fdc32a4432113250c398ec24c2f","observation_id":"0f5fb8ed-eb7f-4d78-a561-d48b5f067980","resolution":{"observed_at":"2026-08-12T15:33:27.559154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-12T15:33:27.597794Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.597794Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:a90914aa66f0dc539acb66fca130d6f6ce1055d1e96a74620e7dd3b01c857834","observation_id":"205a6793-af32-450d-9f26-0bdfd8316df2","resolution":{"observed_at":"2026-08-12T15:33:27.597794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.858125Z","title":"LLaV A- video: Video instruction tuning with synthetic data.Transactions on Machine Learning Research, 2025","venue":null,"work_id":"c6144cef-ec72-4fae-82c8-7e6efd13d047","year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.627853Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:e3fc87d6ab1d9072cd8b817c9554c8cb708af2a215705db5b4923b426791bbb5","observation_id":"61b7547e-1d9b-4a8b-9164-36bb4225850c","resolution":{"observed_at":"2026-08-12T15:33:31.861793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.848964Z","title":"Probing the 3d awareness of visual foundation models","venue":null,"work_id":"524325b0-7dd8-447c-a07c-efea5154c318","year":2024},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.662301Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:19433b132e1b5ba07a5de6724d0eb71797f329af2d7ce916e2c673bb470c2f1c","observation_id":"7bb53d38-73a0-4035-a903-7194cffba8ed","resolution":{"observed_at":"2026-08-12T15:33:31.851699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.693368Z","title":"Sti- bench: Are mllms ready for precise spatial-temporal world understanding? InProceedings of the IEEE/CVF International Conference on Computer Vision, pages 5622–5632, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.693368Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:c0b746623233d6e676ad7dc701229c5e6d6abf3e0812cf2a469f3c4cb386ca5a","observation_id":"5cf0e01c-42fd-495e-a90d-a30d3d2c7c98","resolution":{"observed_at":"2026-08-12T15:33:27.693368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.750364Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.750364Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:be7ed09d1bc4511ca50f122d5cd7e8886069ca08a8e4c4d9dfa7c0d21cec6fda","observation_id":"87d6ce1f-049d-4151-902c-6f4b92e319bd","resolution":{"observed_at":"2026-08-12T15:33:27.750364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.802712Z","title":"Vlm4d: Towards spatiotem- poral awareness in vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.802712Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:138cb597dec4da0433b5c0d107b725c9e302fbf1beb296f6eb2d71919b0193f1","observation_id":"ccddb12c-aba2-4058-990e-f3875f62cebe","resolution":{"observed_at":"2026-08-12T15:33:27.802712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:27.915456Z","title":"Cambrian-s: Towards spatial supersensing in video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.915456Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:2026973a20a60a61c305611cf4da81800ed7557d1c02963f19dc9e13b0f13f1b","observation_id":"4a06d401-c430-4d9c-bbd9-3f0656262306","resolution":{"observed_at":"2026-08-12T15:33:27.915456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11581","last_updated":"2025-05-16T16:28:34Z","snapshot_observed_at":"2026-08-10T01:00:27.173898Z","submitted_at":"2025-05-16T16:28:34Z","title":"Questioning Representational Optimism in Deep Learning: The Fractured Entangled Representation Hypothesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11581","snapshot_observed_at":"2026-08-12T15:33:27.973683Z","title":"Questioning representational optimism in deep learning: The fractured entangled representation hypothesis.arXiv preprint arXiv:2505.11581, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:27.973683Z"},"links":{"cited_paper":"/paper/2505.11581","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:65e9e9aaaf516f7bfda0d0236c1319e981d71427cb9deb101434f3daca744a4a","observation_id":"beac19f4-b222-40b6-9e7e-69cf97e0fcbe","resolution":{"observed_at":"2026-08-12T15:33:27.973683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.004225Z","title":"Learning from videos for 3d world: Enhancing mllms with 3d vision geometry priors.arXiv preprint arXiv:2505.24625, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.004225Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:12ebc64477078bd8a50347e8b4a0230097b7a8e1d9cb09f76247bfd99ff8fc96","observation_id":"4647a97b-0e1f-4c31-bcbd-a85f98f5f94e","resolution":{"observed_at":"2026-08-12T15:33:28.004225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-12T15:33:28.057213Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.057213Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:a4be509ec250ac28ecab22c711607fb366dbcfb04cf7f21e3ce00f6df2d94af0","observation_id":"f434eff9-3b11-4021-8934-ecd778e162be","resolution":{"observed_at":"2026-08-12T15:33:28.057213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.772158Z","title":"Unsupervised natural experience rapidly alters invariant object representation in visual cortex.science, 321(5895):1502–1507, 2008","venue":null,"work_id":"954ee1e9-3887-4626-bb8f-1b2126a56e46","year":2008},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.107936Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:9df86364a76f6250eb4ec19cf72c9065953b92df2ea77eec2865f3c30042d431","observation_id":"c976a4dc-f4a9-40f3-b939-dd1c9a60943b","resolution":{"observed_at":"2026-08-12T15:33:31.803965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.611370Z","title":"Slow feature analysis: Unsupervised learning of invariances.Neural computation, 14(4):715–770, 2002","venue":null,"work_id":"46f7d12a-bb4c-400d-9f79-e29214ac4684","year":2002},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.143957Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:9c289466de9bae220f2e2e1867144ce60b8f6ca8c9e451a0e87945fe38e6e4c3","observation_id":"a77fa326-3b6b-490e-bc6b-4cf2003d5c93","resolution":{"observed_at":"2026-08-12T15:33:31.688307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.182390Z","title":"The tolman-eichenbaum machine: unifying space and relational memory through generalization in the hippocampal formation.Cell, 183(5):1249– 1263, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.182390Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:e964b21d645a0bac7c815f630793ce2391c20e7372f59fa9d07aae95f95819a0","observation_id":"f1a1f640-c5ea-4332-b960-e17a12b4f2f1","resolution":{"observed_at":"2026-08-12T15:33:28.182390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.553367Z","title":"Psychology of spatial cognition.Wiley Interdisciplinary Reviews: Cognitive Science, 3(6):565–580, 2012","venue":null,"work_id":"baaf7bd6-d0b9-442c-8aae-84aefaff08f1","year":2012},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.212915Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:3937d065d0a2adf9a9de91085a9fcae00e4eef549f705674963168b5921d73b5","observation_id":"0b40abdd-a5db-4460-8a8c-2ef393025aae","resolution":{"observed_at":"2026-08-12T15:33:31.556519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-12T15:33:28.247419Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.247419Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:5a3aae890800fe78391c197d08a3f5acbedf44f68d8ebb1cfe22269e173f2881","observation_id":"a6faf50b-53c7-4948-b050-b6ca50e69b8f","resolution":{"observed_at":"2026-08-12T15:33:28.247419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-12T15:33:28.289469Z","title":"Goucher, Adam Perelman, Aditya Ramesh, Aidan Clark, AJ Ostrow, Akila Welihinda, Alan Hayes, Alec Radford, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.289469Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:42e5cf567b8a66f4b4339520573e53377ba079252802d1f2cc13f2e76a3e12f0","observation_id":"67da9146-8180-461b-920c-a09a20989136","resolution":{"observed_at":"2026-08-12T15:33:28.289469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23765","last_updated":"2025-07-17T03:46:15Z","snapshot_observed_at":"2026-08-11T10:07:56.752381Z","submitted_at":"2025-03-31T06:30:35Z","title":"STI-Bench: Are MLLMs Ready for Precise Spatial-Temporal World Understanding?","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23765","snapshot_observed_at":"2026-08-12T15:33:28.317477Z","title":"Sti- bench: Are mllms ready for precise spatial-temporal world understanding?arXiv preprint arXiv:2503.23765, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.317477Z"},"links":{"cited_paper":"/paper/2503.23765","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:5e75603b0e91f125587c86fccbedc149c29d3b25d80135aaf3c2fecf84faba1a","observation_id":"7c938b5e-59a1-4a40-bc81-2a4b0f23cbd7","resolution":{"observed_at":"2026-08-12T15:33:28.317477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02095","snapshot_observed_at":"2026-08-12T15:33:28.342219Z","title":"Vlm4d: Towards spatiotemporal awareness in vision language models.arXiv preprint arXiv:2508.02095, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.342219Z"},"links":{"cited_paper":"/paper/2508.02095","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:dd620cfd29cfa93094eaa406786113bdbf3613266b3ab082c1870bdf908f2e92","observation_id":"d9ce87d5-a09d-4627-9a8c-8812128504eb","resolution":{"observed_at":"2026-08-12T15:33:28.342219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-12T15:33:28.364382Z","title":"Learning transferable visual models from natural language supervision.arXiv preprint arXiv:2103.00020, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.364382Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:b727242cdc32beb1537d42d66447cb0b48e71f8b0b016ae9ef104fec1a3ccedf","observation_id":"6ccf82cd-9f78-4f08-9861-33308bddca74","resolution":{"observed_at":"2026-08-12T15:33:28.364382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-12T15:33:28.381618Z","title":"Sigmoid loss for language image pre-training.arXiv preprint arXiv:2303.15343, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.381618Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:c618b37382842273ee3d054975b786d94b94df3e96d9f9d2c95cff21addc9a7f","observation_id":"1c083e24-1267-4b2f-94ec-a3fe365ffef1","resolution":{"observed_at":"2026-08-12T15:33:28.381618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-12T15:33:28.399065Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms.arXiv preprint arXiv:2406.16860, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.399065Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:c635838cffe1dab86b12d48dac4edc07aea6b565ce90e45d1bf3b1d9dc7a9ce1","observation_id":"8e3a871a-0a6a-473f-a70b-2be1a1d4fa0f","resolution":{"observed_at":"2026-08-12T15:33:28.399065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.460314Z","title":"O’Sullivan, Fang Cao, Tahoura Nedaee, Kamyar Rajabalifardi, Fei-Fei Li, Ehsan Adeli, and Euan Ashley","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.460314Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:51e7f40f9f9f0fb800ba8044fde3211f03e269e8e5a39be2beee5cb534abda9c","observation_id":"96ab4e6c-53d2-426a-abc4-f0e554584a1f","resolution":{"observed_at":"2026-08-12T15:33:28.460314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.508799Z","title":"From flatland to space: Teaching vision-language models to perceive and reason in 3d.arXiv preprint arXiv:2503.22976, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.508799Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:18d77f15b54e4a70bf235dcbb66ad57b0de83814049200c3e1b91e2a1e093998","observation_id":"f65e9dfb-4032-429b-9eef-45796e4626c8","resolution":{"observed_at":"2026-08-12T15:33:28.508799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.562622Z","title":"Visual spatial tuning.arXiv preprint arXiv:2511.05491, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.562622Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:1182ed7cf78848d6c272395005a3baabbc326a97e4b88eb2e7227851a992772a","observation_id":"ebcc31ef-8308-4671-a011-7d8922eaf6e2","resolution":{"observed_at":"2026-08-12T15:33:28.562622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04670","last_updated":"2025-11-06T18:55:17Z","snapshot_observed_at":"2026-07-06T22:35:07.844255Z","submitted_at":"2025-11-06T18:55:17Z","title":"Cambrian-S: Towards Spatial Supersensing in Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.04670","snapshot_observed_at":"2026-08-12T15:33:28.585047Z","title":"Cambrian-s: Towards spatial supersensing in video.arXiv preprint arXiv:2511.04670, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.585047Z"},"links":{"cited_paper":"/paper/2511.04670","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:320e09054ca8d1f6224b1a3a8e6eb88cf94929d8a989de35bd9e4f75ebe5baac","observation_id":"06b1887d-f586-4ca0-8901-29e9cdbf6dd2","resolution":{"observed_at":"2026-08-12T15:33:28.585047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.614240Z","title":"Vggt: Visual geometry grounded transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.614240Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:d759a67192cade1e649279aa1609c57caee6464dc0ff2e4e7baf1540bf4fafc7","observation_id":"da5f7c1d-cf31-4b45-84aa-571d67dcbbf6","resolution":{"observed_at":"2026-08-12T15:33:28.614240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.538818Z","title":"Continuous 3d perception model with persistent state","venue":null,"work_id":"9c506f1c-1b7d-4720-a680-faba2b5bf0c1","year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.641131Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:610047d64c691684b665b6803a6b852ad09555a683896d528a49d35ccb98feed","observation_id":"10bccea0-33e6-4810-9190-2e9cd6e583d6","resolution":{"observed_at":"2026-08-12T15:33:31.541921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.27437","last_updated":"2026-05-02T17:42:29Z","snapshot_observed_at":"2026-08-02T12:27:33.147868Z","submitted_at":"2026-03-28T22:49:40Z","title":"SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.27437","snapshot_observed_at":"2026-08-12T15:33:28.651082Z","title":"Spatialstack: Layered geometry-language fusion for 3d vlm spatial reasoning.arXiv preprint arXiv:2603.27437, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.651082Z"},"links":{"cited_paper":"/paper/2603.27437","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:6c0aef90b69b7e119e349eeea005c291b7fdf68f7548008ee24bd0966e9e8858","observation_id":"084fcc2b-0416-453a-88f8-c2da350228e7","resolution":{"observed_at":"2026-08-12T15:33:28.651082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.682876Z","title":"G2vlm: Geometry grounded vision language model with unified 3d reconstruction and spatial reasoning.arXiv preprint arXiv:2511.21688, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.682876Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:7763037a176a9c4bceba2d11609643431249a01cf29a49c935193cfd0996b3f0","observation_id":"bb3b1a12-f7d2-46a3-a3ef-2d507a968d3b","resolution":{"observed_at":"2026-08-12T15:33:28.682876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.731186Z","title":"Think with 3d: Geometric imagination grounded spatial reasoning from limited views.arXiv preprint arXiv:2510.18632, 2026","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.731186Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:a3cd955d76169c459bb2925eed479c90a7c418c4ff040ee0e6e25700f2fab83e","observation_id":"a6476444-98df-496a-8dec-752400d760ba","resolution":{"observed_at":"2026-08-12T15:33:28.731186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04476","last_updated":"2026-05-12T10:07:13Z","snapshot_observed_at":"2026-08-11T01:23:00.247206Z","submitted_at":"2026-02-04T12:04:02Z","title":"Vision-aligned Latent Reasoning for Multi-modal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04476","snapshot_observed_at":"2026-08-12T15:33:28.783675Z","title":"Vision-aligned latent reasoning for multi-modal large language model.arXiv preprint arXiv:2602.04476, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.783675Z"},"links":{"cited_paper":"/paper/2602.04476","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:bf54c1fd39a7442d8b703312be4ba8760e1a813a387d83b6bd9fa87cda3399fc","observation_id":"a7c3b56b-2384-4993-af06-ca9fde4930fb","resolution":{"observed_at":"2026-08-12T15:33:28.783675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.487385Z","title":"Cambridge University Press, 2001","venue":null,"work_id":"d1024fa9-b23a-4fa8-a456-63e219189457","year":2001},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.816106Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:4eb699145e07bf7fa6279dbd57f47c7292812f12e795bb3383b59f62f64db24f","observation_id":"420ee94e-dab1-4a97-b330-7b95dfc9d6f4","resolution":{"observed_at":"2026-08-12T15:33:31.508886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.837244Z","title":"Cambridge University Press, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.837244Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:c8d9a00bf12b620f085e39cd089523e58dfbe02a54a1427671dfe26ea37ab8fd","observation_id":"a1e511ba-3ad4-4ca0-be74-f96a6923cdf0","resolution":{"observed_at":"2026-08-12T15:33:28.837244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.847346Z","title":"Relational knowledge distillation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.847346Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:5672e95bcacef9157ed2acf67c88a227af45c94abd99568b6f922eccaf942f9b","observation_id":"58daaab1-74dc-4075-be49-655b718d8179","resolution":{"observed_at":"2026-08-12T15:33:28.847346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-12T15:33:28.881926Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.881926Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:af57e2ab55db99be2981b446912181520a3ef5b2fbde72c94d65d38c87ee8852","observation_id":"c5c2a94d-f3f4-41d6-824f-99fc63b9abef","resolution":{"observed_at":"2026-08-12T15:33:28.881926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13181","last_updated":"2025-04-28T18:01:39Z","snapshot_observed_at":"2026-08-11T19:32:15.215968Z","submitted_at":"2025-04-17T17:59:57Z","title":"Perception Encoder: The best visual embeddings are not at the output of the network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13181","snapshot_observed_at":"2026-08-12T15:33:28.893432Z","title":"Perception encoder: The best visual embeddings are not at the output of the network.arXiv preprint arXiv:2504.13181, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.893432Z"},"links":{"cited_paper":"/paper/2504.13181","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:f3872704454a43dae271b685a809489d979bbf771e1fa848e630445c1ad713e7","observation_id":"ceadf3e1-0473-4f8c-8652-8cbde385cbba","resolution":{"observed_at":"2026-08-12T15:33:28.893432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.414097Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":"708c88e2-b2cd-440f-ba63-18d970bd8ff5","year":2017},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.897760Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:4bde8547d6c44bfd65027ca321884420adb6eec519300817ef935a1fc0664dd4","observation_id":"b7f2d45a-2f0f-4047-ba08-e8d01fcba513","resolution":{"observed_at":"2026-08-12T15:33:31.442289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.346633Z","title":"Videorepa: Learning physics for video generation through relational alignment with foundation models.Advances in Neural Information Processing Systems, 38:122647– 122676, 2026","venue":null,"work_id":"6d01e691-60f2-478e-838a-c546dd9a17f1","year":2026},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.927333Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:bfc390494cc79fc03426be8a74aeb3a5f8ef206246ec7e3519a5d364f9795540","observation_id":"7d9ab556-828c-43a9-95f8-2f452d8dee24","resolution":{"observed_at":"2026-08-12T15:33:31.383300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.228517Z","title":"Moalign: Motion-centric representation alignment for video diffusion models","venue":null,"work_id":"87638d88-5539-4190-af90-e5d087628131","year":2026},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.983429Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:d52f8f103e993b4f395b3ed8af652ca46ad23c0057fa33dc3de6d74ea1489a2f","observation_id":"ae99a4e1-13d8-4c11-97b7-8dc38ff6acaa","resolution":{"observed_at":"2026-08-12T15:33:31.272471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.131651Z","title":"Lever- aging vision-language models for improving domain generalization in image classification","venue":null,"work_id":"e9873790-a4dd-4bae-a91f-8ba095154d2a","year":2024},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.047125Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:6831dd6179f20f76493d56a0277b6ae0ebbf29ffbaeb3bea8337c314232204f5","observation_id":"34256c33-f0dd-4f2e-83d0-80391481943f","resolution":{"observed_at":"2026-08-12T15:33:31.153761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T15:33:29.100129Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.100129Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:7623790c83e5b9a0fdd68d76c88ecf8e44798e95fe2f5d66eefdeb15a8f8414d","observation_id":"b33995ff-cbda-4283-84df-d2ae3fc1b135","resolution":{"observed_at":"2026-08-12T15:33:29.100129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11417","last_updated":"2023-08-22T13:02:23Z","snapshot_observed_at":"2026-07-06T16:09:01.219664Z","submitted_at":"2023-08-22T13:02:23Z","title":"ScanNet++: A High-Fidelity Dataset of 3D Indoor Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11417","snapshot_observed_at":"2026-08-12T15:33:29.148328Z","title":"Scannet++: A high-fidelity dataset of 3d indoor scenes.arXiv preprint arXiv:2308.11417, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.148328Z"},"links":{"cited_paper":"/paper/2308.11417","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:41af557542da9b0d6fe67e12a9375c357da07df718bacbe077966883c67283fa","observation_id":"be2c11c2-5218-40a3-9139-f67c19d73469","resolution":{"observed_at":"2026-08-12T15:33:29.148328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08897","last_updated":"2022-01-12T08:19:29Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-17T04:27:01Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08897","snapshot_observed_at":"2026-08-12T15:33:29.171413Z","title":"Arkitscenes: A diverse real-world dataset for 3d indoor scene understanding using mobile rgb-d data.arXiv preprint arXiv:2111.08897, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.171413Z"},"links":{"cited_paper":"/paper/2111.08897","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:b875e6eee17201c8df2cdb02413049dfd680908409af3e2fe7059242fff08125","observation_id":"b9bca34a-8a20-46eb-b56e-c75c6970ab98","resolution":{"observed_at":"2026-08-12T15:33:29.171413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:29.175284Z","title":"Scaling spatial intelligence with multimodal foundation models.arXiv preprint arXiv:2511.13719, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.175284Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:64597e1467d73f4db63088ba1387db1c7deb5d122e4e6cfe9d9f886808392860","observation_id":"8a819d40-0fd1-4343-a531-38dee812edd0","resolution":{"observed_at":"2026-08-12T15:33:29.175284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T15:33:29.181722Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.181722Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:5933f8cf66a9e49661d302e5309085ee22fa31e36dd5b04d4bc6f3b4d19bd216","observation_id":"f08d0c3c-1a81-4e3a-8b09-b52449f00a60","resolution":{"observed_at":"2026-08-12T15:33:29.181722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-13T00:05:34.358839Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-12T15:33:29.184264Z","title":"Grounded 3d-llm with referent tokens.arXiv preprint arXiv:2405.10370, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.184264Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:8acf1e34e14e2d9de2b061b061cb2e144a495aa4829e345a29655de13ac7d628","observation_id":"7d3efa8d-16ba-4abc-a9bd-0e210dd59505","resolution":{"observed_at":"2026-08-12T15:33:29.184264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11442","last_updated":"2024-07-24T07:31:37Z","snapshot_observed_at":"2026-08-13T00:04:26.905756Z","submitted_at":"2024-05-19T04:35:05Z","title":"Unifying 3D Vision-Language Understanding via Promptable Queries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11442","snapshot_observed_at":"2026-08-12T15:33:29.188680Z","title":"Unifying 3d vision-language understanding via promptable queries.arXiv preprint arXiv:2405.11442, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.188680Z"},"links":{"cited_paper":"/paper/2405.11442","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:4454b3251d4058a6056173b5b8ff09d91ef985837890dce11390fab8e14c8f78","observation_id":"d48dd1ca-9762-44c5-a86c-d64e53f01c20","resolution":{"observed_at":"2026-08-12T15:33:29.188680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-13T05:03:16.391892Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-12T15:33:29.215429Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers.arXiv preprint arXiv:2312.08168, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.215429Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:d3e64bf41d91756301490ab9842848f7a3fce30640d1dbba5d01a80fa193b859","observation_id":"80814b0b-2ab0-46c3-a529-d5a44720240d","resolution":{"observed_at":"2026-08-12T15:33:29.215429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00513","last_updated":"2025-06-16T13:53:34Z","snapshot_observed_at":"2026-08-07T17:37:13.030352Z","submitted_at":"2025-03-01T14:38:42Z","title":"Inst3D-LMM: Instance-Aware 3D Scene Understanding with Multi-modal Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00513","snapshot_observed_at":"2026-08-12T15:33:29.277581Z","title":"Inst3d-lmm: Instance-aware 3d scene understanding with multi-modal instruction tuning.arXiv preprint arXiv:2503.00513, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.277581Z"},"links":{"cited_paper":"/paper/2503.00513","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:93b3e94078df8d7c96d9d2c78d588d41e3d7f31e7ca618185ee4099583f5230b","observation_id":"8f0e4626-515e-4a87-82c9-1358dc631503","resolution":{"observed_at":"2026-08-12T15:33:29.277581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-12T01:26:20.728055Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01163","snapshot_observed_at":"2026-08-12T15:33:29.320043Z","title":"3d-llava: Towards generalist 3d lmms with omni superpoint transformer.arXiv preprint arXiv:2501.01163, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.320043Z"},"links":{"cited_paper":"/paper/2501.01163","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:b3dc0581e9025583960a5690f6f07e509f86be248ba87fc35aa1720be52fef3f","observation_id":"08779163-fc63-47d5-92c3-8e12b46253ba","resolution":{"observed_at":"2026-08-12T15:33:29.320043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-08-12T22:36:38.589325Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-12T15:33:29.367094Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness.arXiv preprint arXiv:2409.18125, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.367094Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:1e16191f002eb195a958504353f554ea977dac1d6cdc38beebe790b4dbaefd4b","observation_id":"3a337eac-a6ff-4da2-9b54-bef0828e8066","resolution":{"observed_at":"2026-08-12T15:33:29.367094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00493","last_updated":"2025-03-27T10:30:42Z","snapshot_observed_at":"2026-08-12T23:13:45.948951Z","submitted_at":"2024-11-30T14:28:53Z","title":"Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00493","snapshot_observed_at":"2026-08-12T15:33:29.383190Z","title":"Video-3d llm: Learning position-aware video representation for 3d scene understanding.arXiv preprint arXiv:2412.00493, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.383190Z"},"links":{"cited_paper":"/paper/2412.00493","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:baf96f83cf9e5b5ffae48e8eca11a09f3997533aa2b357b1b8d7db4ce6e225e3","observation_id":"a34fcf9c-3f7f-4b4b-b317-abf2803f0958","resolution":{"observed_at":"2026-08-12T15:33:29.383190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01901","last_updated":"2025-04-02T16:59:55Z","snapshot_observed_at":"2026-08-07T16:14:03.001458Z","submitted_at":"2025-04-02T16:59:55Z","title":"Ross3D: Reconstructive Visual Instruction Tuning with 3D-Awareness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01901","snapshot_observed_at":"2026-08-12T15:33:29.389249Z","title":"Ross3d: Reconstructive visual instruction tuning with 3d-awareness.arXiv preprint arXiv:2504.01901, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.389249Z"},"links":{"cited_paper":"/paper/2504.01901","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:b11f07f61e1b2bcca60bfa035f8083110126519667177b9e0b7f54ebc0433a5b","observation_id":"42c428b8-ffda-4025-99c0-b416bcb1efcc","resolution":{"observed_at":"2026-08-12T15:33:29.389249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.08830","last_updated":"2020-11-11T09:33:31Z","snapshot_observed_at":"2026-07-06T08:45:31.167221Z","submitted_at":"2019-12-18T19:00:49Z","title":"ScanRefer: 3D Object Localization in RGB-D Scans using Natural Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.08830","snapshot_observed_at":"2026-08-12T15:33:29.392263Z","title":"Chang, and Matthias Nießner","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.392263Z"},"links":{"cited_paper":"/paper/1912.08830","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:99d924c2763c5c0c545fbc69b3d8db07acacdeff4ed5baa90f975eda1e5f6cfb","observation_id":"5a57a09e-1a22-4cf4-aabe-9ef8fe282024","resolution":{"observed_at":"2026-08-12T15:33:29.392263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05251","last_updated":"2023-09-11T06:03:39Z","snapshot_observed_at":"2026-08-12T23:25:56.359255Z","submitted_at":"2023-09-11T06:03:39Z","title":"Multi3DRefer: Grounding Text Description to Multiple 3D Objects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05251","snapshot_observed_at":"2026-08-12T15:33:29.395853Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.395853Z"},"links":{"cited_paper":"/paper/2309.05251","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:b093380c5002b1c728e11069bc1e0fdaefeb56ade721b11b9e6ec3482fdde91b","observation_id":"59ee0b39-5d19-4f57-8997-2578b3ce65f0","resolution":{"observed_at":"2026-08-12T15:33:29.395853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.02206","last_updated":"2020-12-03T19:00:05Z","snapshot_observed_at":"2026-07-06T10:20:30.345301Z","submitted_at":"2020-12-03T19:00:05Z","title":"Scan2Cap: Context-aware Dense Captioning in RGB-D Scans","version":1},"cited_work":{"arxiv_id":"2012.02206","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.02206","snapshot_observed_at":"2026-08-12T15:33:29.969465Z","title":"Scan2Cap: Context-aware Dense Captioning in RGB-D Scans","venue":"cs.CV","work_id":"6a676092-a676-4db4-a0bc-ad1c57c7a3f0","year":2020},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.399144Z"},"links":{"cited_paper":"/paper/2012.02206","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:1b21f47d3468fc821904321121ae8618441d068e23d001b2ad171f4899a07fd9","observation_id":"8ebeea71-6527-44ba-a6a1-93d19a00a5f6","resolution":{"observed_at":"2026-08-12T15:33:29.990241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10482","last_updated":"2022-05-07T21:55:42Z","snapshot_observed_at":"2026-08-06T20:05:44.224796Z","submitted_at":"2021-12-20T12:30:55Z","title":"ScanQA: 3D Question Answering for Spatial Scene Understanding","version":3},"cited_work":{"arxiv_id":"2112.10482","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.10482","snapshot_observed_at":"2026-08-12T15:33:29.912941Z","title":"ScanQA: 3D Question Answering for Spatial Scene Understanding","venue":"cs.CV","work_id":"810487a0-f85e-4d22-8af4-1a643713f0fe","year":2021},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.425799Z"},"links":{"cited_paper":"/paper/2112.10482","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:0ba445462de8c3d961139d5282a25ddaf559604ff51c84be41b14ed4e4b964c7","observation_id":"8636b1ed-3519-4725-a936-864a867a45f7","resolution":{"observed_at":"2026-08-12T15:33:29.939265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-11T02:19:20.093098Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-12T15:33:29.481703Z","title":"Sqa3d: Situated question answering in 3d scenes.arXiv preprint arXiv:2210.07474, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.481703Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:d1b39cd0ab06b01942322d4365b6cb2f6816070a465b06be0fef099fb84dc921","observation_id":"32cd7efc-d531-4675-b0dc-53185f7009b0","resolution":{"observed_at":"2026-08-12T15:33:29.481703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03105","last_updated":"2023-04-12T09:22:53Z","snapshot_observed_at":"2026-07-06T14:01:25.012788Z","submitted_at":"2022-10-06T17:55:09Z","title":"Mask3D: Mask Transformer for 3D Semantic Instance Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03105","snapshot_observed_at":"2026-08-12T15:33:29.538485Z","title":"What is the length of the longest dimension . . . of the <object>. . . ?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.538485Z"},"links":{"cited_paper":"/paper/2210.03105","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:672e57d7acee303f61dab6da0af919142f4605d8b8259d9dc40b2be66afca6b8","observation_id":"42ce05c5-32e2-4ad2-9e09-cdabc4cfc9f1","resolution":{"observed_at":"2026-08-12T15:33:29.538485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.113374Z","title":null,"venue":null,"work_id":"4f2989eb-7f32-46ff-8034-d2c84e330149","year":null},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.598617Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:12630abc94598ea36233a037fb329112b901bf691d714fb17cb86da56cde154f","observation_id":"f6c8680a-2431-4bca-ac4a-f9586d1bbc40","resolution":{"observed_at":"2026-08-12T15:33:31.122134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.022698Z","title":null,"venue":null,"work_id":"7b74119c-c3e6-495a-8b35-0bf6cecca4a2","year":null},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.662827Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:84a4e21f2e1fb9580391222aac260d5109f73188629fb2f51bb2083e08dda37a","observation_id":"d4b87380-ad14-4e41-9610-156e596fdc85","resolution":{"observed_at":"2026-08-12T15:33:31.075624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:30.862000Z","title":null,"venue":null,"work_id":"df7231dc-707e-460e-ba31-377aea783a2d","year":null},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.699550Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:e711bbe9ce3f1b8db6091b7580594b5fedc6b8d41155a10c93badf0fc1d22f9a","observation_id":"282e49fa-6365-421a-adb5-a8656ab047ed","resolution":{"observed_at":"2026-08-12T15:33:30.938959Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:30.821197Z","title":null,"venue":null,"work_id":"67b810ad-92e7-4ade-8f5b-9287d84a9470","year":null},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.734512Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:dea0f94535744b7eba1f47f7e7314f198eac2e9fae2956e49b59e5d27120fbe0","observation_id":"16b01bc7-69f0-4b7c-8490-4910cfaabd85","resolution":{"observed_at":"2026-08-12T15:33:30.824082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:30.812483Z","title":"We retain only patches that contain at least one valid-depth pixel; let V ⊆ {1,","venue":null,"work_id":"4e00af71-3939-48fb-9c72-ab45ef5bf75b","year":null},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.739770Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:a9413049f4a7dd9a70d95c559cc13fb453fc5cea42d335f46ce8b46980f6644d","observation_id":"7b4a6676-c5b5-4cf8-a6a7-226466578864","resolution":{"observed_at":"2026-08-12T15:33:30.815753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:30.776219Z","title":null,"venue":null,"work_id":"49ee01b3-80c3-435f-a113-a2dcf02b4f7b","year":null},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.742791Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:2a114523b4fb6940152fe6c8049ae600a18de8c8606959e6ab24d85701f3611a","observation_id":"cc25501e-7ad7-4c4b-a7c8-1fa287ff6a73","resolution":{"observed_at":"2026-08-12T15:33:30.807455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:30.675329Z","title":null,"venue":null,"work_id":"45f243e7-d4e9-4036-a7d7-3e094da0bcb4","year":null},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.745742Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:df6daacf9eb95eb52592fa6573c735ac6384ead3099c275bd29f5a6dcfe7a9d6","observation_id":"34ded46c-8425-4293-aec7-003f99db8477","resolution":{"observed_at":"2026-08-12T15:33:30.730339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:30.597297Z","title":"Dist., Room Size, Rel","venue":null,"work_id":"21d24a5d-363f-4f20-86e7-a364f23311b5","year":null},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.749409Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:b178a5bb91800655885cee6b7cf9f91799f49390d5ecff6013b7b3e980ed2768","observation_id":"79576ef0-f845-47b8-ae6a-14427c427d17","resolution":{"observed_at":"2026-08-12T15:33:30.611920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:30.526462Z","title":"Feature. Dist","venue":null,"work_id":"277abcb5-9385-4642-9746-6a4e244a43f8","year":null},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.808181Z"},"links":{"citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:4c677c146cbe3c55bfd3e35b01eb6447d046e766ac2786ca1659c222fe415bc6","observation_id":"6aed1b9d-374a-4b8b-8a21-a7fb85a65085","resolution":{"observed_at":"2026-08-12T15:33:30.561614Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T05:24:56.209336Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":2,"verified_fuzzy":14},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 0 inbound Pith citation observations for arXiv:2608.10864."}