{"as_of":"2026-08-05T22:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:083761374a8f18f5d5b2d10c3e350205431752306d22b2e7417fbd41b8b78a48","coverage":[{"denominator":95,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":95,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T12:54:01.013242Z","state":"measured"},{"denominator":166,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":166,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":71,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:38:55.151754Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2507.07982","last_updated":"2026-05-05T14:55:01Z","snapshot_observed_at":"2026-08-04T10:05:27.686733Z","submitted_at":"2025-07-10T17:55:08Z","title":"Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-19T05:13:28.767788Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2507.07982"},"observation_digest":"sha256:bdba406a0444d1c75de2a7d813a717eb12c2ebad48da3aaf0dd52b1a97f22e73","observation_id":"1748d8d8-dcb6-4c53-96ee-9ac2ae4ff15a","resolution":{"observed_at":"2026-05-19T05:17:06.515129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2511.16518","last_updated":"2026-04-28T11:37:12Z","snapshot_observed_at":"2026-07-06T22:36:30.947164Z","submitted_at":"2025-11-20T16:34:55Z","title":"MiMo-Embodied: X-Embodied Foundation Model Technical Report","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T20:40:54.096289Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2511.16518"},"observation_digest":"sha256:2e51fd0e0c7d847d15aa14865653b2a3e6fd066118baf1703937faf109a63aea","observation_id":"18e16956-dcb9-415c-98e7-ffb48e60eabc","resolution":{"observed_at":"2026-05-17T20:42:05.749042Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2511.16567","last_updated":"2026-05-06T15:47:48Z","snapshot_observed_at":"2026-07-06T22:36:30.947164Z","submitted_at":"2025-11-20T17:22:51Z","title":"POMA-3D: The Point Map Way to 3D Scene Understanding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T20:27:27.347592Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2511.16567"},"observation_digest":"sha256:944c1447a502d1163a3aa3d431ef308753000adc42e79b4273e07728a75c00be","observation_id":"8beef7b3-9c22-424a-9346-c780f52d2a60","resolution":{"observed_at":"2026-05-17T20:30:11.587250Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2511.18960","last_updated":"2026-04-10T05:31:27Z","snapshot_observed_at":"2026-08-05T07:51:27.008234Z","submitted_at":"2025-11-24T10:22:28Z","title":"AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T06:28:22.652509Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2511.18960"},"observation_digest":"sha256:e205f8a14b1ca9201d039cab85218041a5094bc11bef5e75ee3c63a6644ebaab","observation_id":"4b37eb10-8f7d-4afa-a7bd-7b914bb2bdd3","resolution":{"observed_at":"2026-05-17T06:29:09.920022Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-03T20:38:55.151754Z","title":"Vlm-3r: Vision-language models aug- mented with instruction-aligned 3d reconstruction, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.151754Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:e7e2ca733da5e288a0d50291b003f3ce225b84a3c49c3629b385ec2ef37e515a","observation_id":"72fc96a9-1852-4a86-a0bd-ed1dcd958dde","resolution":{"observed_at":"2026-08-03T20:38:55.151754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-03T20:15:31.896130Z","title":"Vlm-3r: Vision-language models aug- mented with instruction-aligned 3d reconstruction.arXiv preprint arXiv:2505.20279, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20644","last_updated":"2026-07-09T17:59:10Z","snapshot_observed_at":"2026-08-03T20:15:29.231318Z","submitted_at":"2025-11-25T18:59:02Z","title":"Vision-Language Memory for Spatial Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T20:15:31.896130Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2511.20644"},"observation_digest":"sha256:a90b82f53c50ae8d2b5bf5ed5c164275ed5ffd5b9f54162eec70535782e81ff6","observation_id":"21301638-439e-4870-8602-cdf4736ed86b","resolution":{"observed_at":"2026-08-03T20:15:31.896130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-03T16:27:29.726654Z","title":"Vlm-3r: Vision-language models aug- mented with instruction-aligned 3d reconstruction.arXiv preprint arXiv:2505.20279, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13660","last_updated":"2026-07-03T09:12:21Z","snapshot_observed_at":"2026-08-03T16:27:22.621857Z","submitted_at":"2025-12-15T18:52:43Z","title":"Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T16:27:29.726654Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2512.13660"},"observation_digest":"sha256:2f5b7fcb4d1cca98c2d77e23ed66aa22bef81ecb4d1b849f80c603a56220a689","observation_id":"8ce4afd6-147d-4bd5-84f1-9cdda824591c","resolution":{"observed_at":"2026-08-03T16:27:29.726654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2512.17012","last_updated":"2026-04-13T01:56:32Z","snapshot_observed_at":"2026-07-06T22:39:28.855621Z","submitted_at":"2025-12-18T19:13:44Z","title":"4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T21:20:38.952416Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2512.17012"},"observation_digest":"sha256:3fb8bbb88e00e15a9c3fadcccc474c1f283ae6f3e128979d7bc3d5d560ecd2b5","observation_id":"a1831e13-f921-45a6-bf70-d21f12765136","resolution":{"observed_at":"2026-05-16T21:21:16.837689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2512.23365","last_updated":"2026-04-09T12:09:38Z","snapshot_observed_at":"2026-07-06T22:40:17.725041Z","submitted_at":"2025-12-29T10:48:54Z","title":"SpatialMosaic: A Multiview VLM Dataset for Partial Visibility","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T19:42:25.626448Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2512.23365"},"observation_digest":"sha256:9441c464eabe2bbbc198780dee2ea333f143bd2f4be7e59f2a25469886438dcb","observation_id":"f3930752-0673-4b19-bf00-18b286a6e413","resolution":{"observed_at":"2026-05-16T19:43:20.635922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2602.06037","last_updated":"2026-05-01T09:36:02Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-05T18:59:32Z","title":"Thinking with Geometry: Active Geometry Integration for Spatial Reasoning","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T06:39:29.010937Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2602.06037"},"observation_digest":"sha256:2d050852805dc27cd17dc4eebbf23b69ae573153cbd9596b5e0eb8202206710f","observation_id":"c41cab4d-fb61-4081-a3a1-95893414ea94","resolution":{"observed_at":"2026-05-16T06:40:42.249141Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-03T03:16:49.980712Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction- Aligned 3D Reconstruction.arXiv preprint 2505.20279,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08735","last_updated":"2026-06-10T06:24:51Z","snapshot_observed_at":"2026-08-05T01:30:16.672169Z","submitted_at":"2026-02-09T14:39:43Z","title":"From Correspondence to Actions: Human-Like Multi-Image Spatial Reasoning in Multi-modal Large Language Models","version":3},"reference_index":1997,"source":"pdf_text","source_observed_at":"2026-08-03T03:16:49.980712Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2602.08735"},"observation_digest":"sha256:ed34955af07301661d015ef56bc8a754e450c53049b28626e791b53607849fde","observation_id":"da88302d-5f16-4054-a7fa-7860c3ea0ee1","resolution":{"observed_at":"2026-08-03T03:16:49.980712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-02T18:06:09.863681Z","title":"arXiv preprint arXiv:2505.20279 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-04T12:39:47.885369Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.863681Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:b3895a5f9154dea4e3ee02552c58979834f07ad1fdcb346853968294185f7e89","observation_id":"2ecc57ab-2221-4b00-8e81-684fbf08f0ed","resolution":{"observed_at":"2026-08-02T18:06:09.863681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2604.01907","last_updated":"2026-04-24T08:02:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-02T11:26:44Z","title":"Lifting Unlabeled Internet-level Data for 3D Scene Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T22:16:57.890955Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2604.01907"},"observation_digest":"sha256:28c9caba9f6bc7052b0481d3b7fa409887ebd3dd9739b7b4e43ca96c3fb2e8b9","observation_id":"52691746-4362-4d09-b91e-28edaf28870f","resolution":{"observed_at":"2026-05-13T22:18:21.027476Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2604.02870","last_updated":"2026-04-03T08:37:08Z","snapshot_observed_at":"2026-08-01T03:43:05.117795Z","submitted_at":"2026-04-03T08:37:08Z","title":"Token Warping Helps MLLMs Look from Nearby Viewpoints","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T21:07:55.062113Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2604.02870"},"observation_digest":"sha256:7939885263848c4d2c98a782d476ed0f1144b426eb54dafec89f7643ba8df68b","observation_id":"a8a92a83-2a37-4d29-9491-ddb7fae99dd0","resolution":{"observed_at":"2026-05-13T21:08:17.319333Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2604.03318","last_updated":"2026-05-25T15:52:36Z","snapshot_observed_at":"2026-07-13T14:39:49.573224Z","submitted_at":"2026-04-01T15:28:13Z","title":"EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T22:41:09.840792Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2604.03318"},"observation_digest":"sha256:09db6fe7767ea1726f1c313aceedc31e47d59c179baeefb884b59cceb6dbefa0","observation_id":"9540fc1d-5bca-4c5f-baa7-747a4ab62bfb","resolution":{"observed_at":"2026-05-13T22:43:22.849324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-07-13T14:39:55.177552Z","title":"Vlm-3r: Vision-language models augmented with instruction-aligned 3d reconstruction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03318","last_updated":"2026-05-25T15:52:36Z","snapshot_observed_at":"2026-07-13T14:39:49.573224Z","submitted_at":"2026-04-01T15:28:13Z","title":"EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMs","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-13T14:39:55.177552Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2604.03318"},"observation_digest":"sha256:dcf2b93f01a7b8a039a05a4726272883668da4a286d20f4973964484d9d32aa9","observation_id":"6304c5ad-c398-44bc-a868-2b2cec354c16","resolution":{"observed_at":"2026-07-13T14:39:55.177552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2604.05695","last_updated":"2026-04-07T10:45:28Z","snapshot_observed_at":"2026-08-03T03:24:51.867211Z","submitted_at":"2026-04-07T10:45:28Z","title":"Let Geometry GUIDE: Layer-wise Unrolling of Geometric Priors in Multimodal LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T19:32:59.381755Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2604.05695"},"observation_digest":"sha256:5c09b1c0c91f56c3eed8dccf72fc7c3173f26ca0bc86f4894dc21722197c1980","observation_id":"59ef32d2-5eae-40c0-ab84-b4d452b401e4","resolution":{"observed_at":"2026-05-10T22:50:48.937546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2604.07296","last_updated":"2026-04-09T09:04:20Z","snapshot_observed_at":"2026-07-06T22:55:33.502756Z","submitted_at":"2026-04-08T17:03:02Z","title":"OpenSpatial: A Principled Data Engine for Empowering Spatial Intelligence","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T17:41:31.544716Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2604.07296"},"observation_digest":"sha256:cca60c77be6db1e025f836678daa5d265ebc06f0cf490547f7e1d8d0f61ac94d","observation_id":"4e775d07-3f13-4c16-8a62-3d50c5bdac36","resolution":{"observed_at":"2026-05-11T06:20:56.452510Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2604.09167","last_updated":"2026-04-10T09:51:42Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T09:51:42Z","title":"MAG-3D: Multi-Agent Grounded Reasoning for 3D Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T17:25:31.097385Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2604.09167"},"observation_digest":"sha256:d126885d9c6d7203df7dbf0244a19978aad233c539ba49521b557468863a6fbd","observation_id":"988ed2c0-e3b9-4738-b948-e4023014ec2a","resolution":{"observed_at":"2026-05-11T06:51:22.687350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2604.09535","last_updated":"2026-04-10T17:53:55Z","snapshot_observed_at":"2026-07-06T22:58:21.624968Z","submitted_at":"2026-04-10T17:53:55Z","title":"EgoTL: Egocentric Think-Aloud Chains for Long-Horizon Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T17:10:36.209152Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2604.09535"},"observation_digest":"sha256:1b6a4eafd6965ee0af546200de19824655916e59ea12c8bed759797f1162dafa","observation_id":"208a0fa6-3e3a-41ec-92d0-ee4dfb2f89f6","resolution":{"observed_at":"2026-05-11T07:26:02.915690Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2604.09781","last_updated":"2026-06-29T09:07:17Z","snapshot_observed_at":"2026-07-12T23:07:19.301563Z","submitted_at":"2026-04-10T18:06:02Z","title":"Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:55:48.506049Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2604.09781"},"observation_digest":"sha256:b9c4eaf3004ffcbcd78ff04526418883a28d3b231145a0aba5568cf79e874262","observation_id":"b7a3b696-8d0f-4da9-99d8-6762a4fe11bb","resolution":{"observed_at":"2026-05-11T07:51:01.840538Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-07-12T23:07:40.699400Z","title":"arXiv:2505.20279 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.09781","last_updated":"2026-06-29T09:07:17Z","snapshot_observed_at":"2026-07-12T23:07:19.301563Z","submitted_at":"2026-04-10T18:06:02Z","title":"Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T23:07:40.699400Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2604.09781"},"observation_digest":"sha256:29f5cd39549cabf52239305e75fe39247c3037dd458ecc2f07798af58c3f7662","observation_id":"669f4dd9-308c-4e4f-b456-43437c4d6cb5","resolution":{"observed_at":"2026-07-12T23:07:40.699400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2604.09862","last_updated":"2026-04-10T19:45:24Z","snapshot_observed_at":"2026-08-03T00:48:42.155502Z","submitted_at":"2026-04-10T19:45:24Z","title":"FF3R: Feedforward Feature 3D Reconstruction from Unconstrained views","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T17:47:52.901901Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2604.09862"},"observation_digest":"sha256:bf38cc02add90b8664c33c11078dbf12763cd52b4cb63e6ac0c11d199402fb23","observation_id":"8cd39307-67d1-4280-a214-54ed885adc0a","resolution":{"observed_at":"2026-05-11T06:05:59.356995Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2604.11331","last_updated":"2026-04-13T11:32:36Z","snapshot_observed_at":"2026-07-06T22:59:45.139155Z","submitted_at":"2026-04-13T11:32:36Z","title":"Any 3D Scene is Worth 1K Tokens: 3D-Grounded Representation for Scene Generation at Scale","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T16:30:33.113292Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2604.11331"},"observation_digest":"sha256:6e547658e4254c3ce064a26d11b913c4c84e7ebd1199bcf67f73d22a93fa2bc3","observation_id":"5148c8c7-2edf-4964-bdd9-757a2185c3e0","resolution":{"observed_at":"2026-05-11T08:45:59.615137Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2604.17385","last_updated":"2026-04-19T11:21:59Z","snapshot_observed_at":"2026-07-06T23:04:28.260463Z","submitted_at":"2026-04-19T11:21:59Z","title":"SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T06:31:30.778309Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2604.17385"},"observation_digest":"sha256:ee97637fdf5b870675062c06be2a7b67075eec4cc0ab49c9a55225c7d6b1ff1f","observation_id":"c6c57998-7704-4748-ba5c-7844ba140ca5","resolution":{"observed_at":"2026-05-10T06:41:37.173534Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2604.24182","last_updated":"2026-07-05T10:54:06Z","snapshot_observed_at":"2026-08-02T12:46:51.494465Z","submitted_at":"2026-04-27T08:44:12Z","title":"$M^2$-VLA: Boosting Vision-Language Models for Generalizable Manipulation via Layer Mixture and Meta-Skills","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T03:13:36.437080Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2604.24182"},"observation_digest":"sha256:858711a5fbf77c7be4ef2778d493acc2a488e3d50c15a69fb4751ff493ab1656","observation_id":"abf82160-1912-4bee-bb4f-9d665413e1bc","resolution":{"observed_at":"2026-05-11T22:11:15.955057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-07-12T18:17:43.564400Z","title":"Vlm-3r: Vision-language models augmented with instruction-aligned 3d reconstruction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.24182","last_updated":"2026-07-05T10:54:06Z","snapshot_observed_at":"2026-08-02T12:46:51.494465Z","submitted_at":"2026-04-27T08:44:12Z","title":"$M^2$-VLA: Boosting Vision-Language Models for Generalizable Manipulation via Layer Mixture and Meta-Skills","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T18:17:43.564400Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2604.24182"},"observation_digest":"sha256:8bedb19d650302a14da5cff1113746bd91eacd74bd3e30d9522f8243b0d26453","observation_id":"7d95985a-5bfc-45e6-9901-549d7b439c0e","resolution":{"observed_at":"2026-07-12T18:17:43.564400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.02130","last_updated":"2026-05-04T01:19:36Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T01:19:36Z","title":"From Where Things Are to What They Are For: Benchmarking Spatial-Functional Intelligence in Multimodal LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-09T17:01:38.481471Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.02130"},"observation_digest":"sha256:54d9ca6c2e686aa08d8c6741a28b1f60efde11dc5c91112bac06bde1f5765369","observation_id":"d56513e2-ee0b-438f-95ff-6b0c9f902ef0","resolution":{"observed_at":"2026-05-11T16:26:07.551530Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.05997","last_updated":"2026-05-22T12:07:44Z","snapshot_observed_at":"2026-08-02T14:48:34.696358Z","submitted_at":"2026-05-07T10:48:46Z","title":"4DThinker: Thinking with 4D Imagery for Dynamic Spatial Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T14:20:08.404090Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.05997"},"observation_digest":"sha256:feec4bf3eb6fe63d427cf1d64ebfba21a7782992f78d6601b6c07a63a6cead83","observation_id":"6ba8aabf-f7a2-4852-ae40-767ea41d21eb","resolution":{"observed_at":"2026-05-11T18:41:11.622389Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.05997","last_updated":"2026-05-22T12:07:44Z","snapshot_observed_at":"2026-08-02T14:48:34.696358Z","submitted_at":"2026-05-07T10:48:46Z","title":"4DThinker: Thinking with 4D Imagery for Dynamic Spatial Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-25T06:15:33.062980Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.05997"},"observation_digest":"sha256:b15f8b85b67eedcfde15c7b3ae4d8412bfe33e55897eac9403c2e04a24f37965","observation_id":"7b1db54e-df36-495e-8276-412ce2a58024","resolution":{"observed_at":"2026-05-25T06:16:39.987125Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.10106","last_updated":"2026-05-11T07:20:09Z","snapshot_observed_at":"2026-07-06T23:22:08.560919Z","submitted_at":"2026-05-11T07:20:09Z","title":"ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T04:00:23.681682Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.10106"},"observation_digest":"sha256:6f09a03e1a95100507b1b0459b8d49f1d615bab8890a075073b3966e318d4ab4","observation_id":"9daa15a9-0708-4dc3-a37e-eee7b909be5b","resolution":{"observed_at":"2026-05-12T06:46:36.484052Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.10588","last_updated":"2026-05-11T13:59:09Z","snapshot_observed_at":"2026-07-06T23:22:32.858399Z","submitted_at":"2026-05-11T13:59:09Z","title":"Thinking with Novel Views: A Systematic Analysis of Generative-Augmented Spatial Intelligence","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-12T03:24:41.877312Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.10588"},"observation_digest":"sha256:a2ec859383448721c05585981667cfb0c45274cb2120085acfe8849f699ba794","observation_id":"4b6c8d52-2ab3-43dc-a562-34b6ec611bd7","resolution":{"observed_at":"2026-05-12T03:26:19.434881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.15876","last_updated":"2026-05-20T09:56:58Z","snapshot_observed_at":"2026-08-02T03:46:43.550240Z","submitted_at":"2026-05-15T11:54:17Z","title":"Unlocking Dense Metric Depth Estimation in VLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T19:20:04.468206Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.15876"},"observation_digest":"sha256:26eb5a6870884f075e3185a579c99948579805282e3480dccd68c31f803cf18f","observation_id":"cb433cfb-8682-4833-960d-027191258f21","resolution":{"observed_at":"2026-05-20T19:23:40.983094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.15876","last_updated":"2026-05-20T09:56:58Z","snapshot_observed_at":"2026-08-02T03:46:43.550240Z","submitted_at":"2026-05-15T11:54:17Z","title":"Unlocking Dense Metric Depth Estimation in VLMs","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T07:54:52.926995Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.15876"},"observation_digest":"sha256:38a6aedaca465c8919f5c33bf29db67e76dcf0b99170d2725aa3765f10ca1103","observation_id":"a871081d-438e-475e-83b5-81e377616e16","resolution":{"observed_at":"2026-05-21T07:59:51.135163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.18746","last_updated":"2026-05-25T08:34:52Z","snapshot_observed_at":"2026-08-02T07:58:31.278661Z","submitted_at":"2026-05-18T17:59:02Z","title":"ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T10:52:22.778489Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.18746"},"observation_digest":"sha256:b958c1c2e939c83469da7113b88dd8f48c53439400c3636824911e8ae7d1f024","observation_id":"2af36fcf-4064-4925-a018-20e654f26702","resolution":{"observed_at":"2026-05-20T10:53:13.231273Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.18746","last_updated":"2026-05-25T08:34:52Z","snapshot_observed_at":"2026-08-02T07:58:31.278661Z","submitted_at":"2026-05-18T17:59:02Z","title":"ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T18:25:17.831116Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.18746"},"observation_digest":"sha256:ccb1e4e21593db84e1fe3f0fc2af9eed96cd24bbc1e0503a849de56ab94c4ea9","observation_id":"78c983b0-1385-49ef-8794-399535244996","resolution":{"observed_at":"2026-07-01T15:05:47.166596Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-05T22:32:42.411847Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:1e140ce2d4b3b7a254fe64f8bd40ee3f50fe5d3209bd98bdfe55021d4688263e","observation_id":"9a01ac1f-6c16-4883-8bf5-7a95a003cd18","resolution":{"observed_at":"2026-05-20T06:33:05.687991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.20165","last_updated":"2026-05-19T17:50:25Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:50:25Z","title":"CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-20T05:27:30.938311Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.20165"},"observation_digest":"sha256:341921b4e99daf68a8e3bc112069cf668ff078d428292c8a0fe2b75dd0aaca96","observation_id":"de6b68d9-e1e1-43f7-97a1-4e02afaee201","resolution":{"observed_at":"2026-05-20T05:28:04.482966Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.22558","last_updated":"2026-05-21T14:40:03Z","snapshot_observed_at":"2026-07-06T23:32:54.127514Z","submitted_at":"2026-05-21T14:40:03Z","title":"GeoWeaver: Grounding Visual Tokens with Geometric Evidence before Scene Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T07:23:53.811794Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.22558"},"observation_digest":"sha256:a7c3cb6dea35a35882a99172e40048e69c07695be67d0b87d184e6e2f2f1f2bf","observation_id":"cd044ad7-e6bb-41fe-869f-895663ee4ec4","resolution":{"observed_at":"2026-05-22T07:24:43.013284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.25371","last_updated":"2026-06-09T02:13:19Z","snapshot_observed_at":"2026-08-03T14:37:55.134830Z","submitted_at":"2026-05-25T02:52:34Z","title":"FOUND-IT: Foundation-model-first Task-driven 3D Scene Graphs with Granularity on Demand","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T22:04:21.666471Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.25371"},"observation_digest":"sha256:34276f42852c2b9d2e0ac67a140e8079705522397a861881cbbffd0cf0166f19","observation_id":"0d1b0f23-44eb-4190-aae2-67b781e2cf15","resolution":{"observed_at":"2026-06-29T22:14:00.409776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.25524","last_updated":"2026-05-25T07:27:28Z","snapshot_observed_at":"2026-08-02T22:33:46.152327Z","submitted_at":"2026-05-25T07:27:28Z","title":"ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T22:23:38.178195Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.25524"},"observation_digest":"sha256:6606860bde0ab200f8cba8f5b34efd1b23cd07a0df4019b5241334e625b5298b","observation_id":"65344bf0-5fc9-41cb-a2fb-ba53442bd7f1","resolution":{"observed_at":"2026-06-29T22:23:59.822765Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.25802","last_updated":"2026-05-25T12:51:35Z","snapshot_observed_at":"2026-08-05T08:07:09.530165Z","submitted_at":"2026-05-25T12:51:35Z","title":"Rethinking VLM Representation for VLA Initialization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T22:21:29.733181Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.25802"},"observation_digest":"sha256:53893ba79f88bed84c4fdca190bceafca9047ca1b22c29281dba3527509d9333","observation_id":"fc22489d-b3ad-44fa-b356-3890aac17da1","resolution":{"observed_at":"2026-06-29T22:24:00.117539Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.27318","last_updated":"2026-07-06T17:18:57Z","snapshot_observed_at":"2026-07-12T15:54:07.137141Z","submitted_at":"2026-05-26T17:26:29Z","title":"Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T18:15:28.261185Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.27318"},"observation_digest":"sha256:55d277d5f0b5139b42d0ded77701ff6adaef7cfc5a58e734c050034a4913e9c5","observation_id":"02ae9c95-43bc-457a-9ec5-5106e037d117","resolution":{"observed_at":"2026-06-29T18:23:51.003446Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-07-12T15:54:12.909974Z","title":"VLM-3R : Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27318","last_updated":"2026-07-06T17:18:57Z","snapshot_observed_at":"2026-07-12T15:54:07.137141Z","submitted_at":"2026-05-26T17:26:29Z","title":"Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-12T15:54:12.909974Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.27318"},"observation_digest":"sha256:fd2a77c91e5bbac8aab6cfda13f281d71318e527aceb7c537668057b4ecc3773","observation_id":"410835b6-7d69-46ff-b0b7-0d3755c92003","resolution":{"observed_at":"2026-07-12T15:54:12.909974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:77e2d4ebe1222522931eed3b10f03c98d613d6fe1421a523e0b31e90a58ed5d5","observation_id":"5ad13a23-9cba-4100-a90f-dd043cf2f2db","resolution":{"observed_at":"2026-06-29T13:43:28.785956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.30231","last_updated":"2026-05-28T17:00:52Z","snapshot_observed_at":"2026-07-06T23:39:34.232661Z","submitted_at":"2026-05-28T17:00:52Z","title":"Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T07:47:52.739735Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.30231"},"observation_digest":"sha256:403753913645408c84de4be077069d706c8840fe7136afcc00a88e6d944b51c0","observation_id":"836f2d3b-50e8-4b3f-9ee7-e0b3200285d5","resolution":{"observed_at":"2026-06-29T07:53:13.591518Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.30561","last_updated":"2026-05-28T20:48:55Z","snapshot_observed_at":"2026-07-06T23:39:48.531480Z","submitted_at":"2026-05-28T20:48:55Z","title":"VLM3: Vision Language Models Are Native 3D Learners","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T07:45:31.978215Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.30561"},"observation_digest":"sha256:696b66417c6f0e4ddad4135350758ea72fc432797d1e0746813c82484892f969","observation_id":"a5efadf7-31ca-43a6-8bbf-9a9b7633b7db","resolution":{"observed_at":"2026-06-29T07:53:14.035073Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2606.00963","last_updated":"2026-05-31T02:36:57Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T02:36:57Z","title":"Reasmory: 3D Reconstruction as Explicit Memory for VLMs Spatial Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T17:46:21.821764Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2606.00963"},"observation_digest":"sha256:ea4fe29a12ee2a003d374bf055f6f6816c6443fd4f5fbd5aaeb3fe051e202d4f","observation_id":"9d4695e3-ec45-4763-b24e-d4daa812bde7","resolution":{"observed_at":"2026-07-01T20:46:13.705434Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2606.05677","last_updated":"2026-06-04T04:00:12Z","snapshot_observed_at":"2026-08-02T16:24:06.015782Z","submitted_at":"2026-06-04T04:00:12Z","title":"LongSpace: Exploring Long-Horizon Spatial Memory from Perception to Recall in Video","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T02:16:25.730555Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2606.05677"},"observation_digest":"sha256:c4fbc0039f610f7fc13aaab87e54ac51a915fb79570887e73db344d8b45f8001","observation_id":"172430c8-6156-4f93-b18f-16d0396fe560","resolution":{"observed_at":"2026-07-02T12:16:57.284944Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2606.05833","last_updated":"2026-06-18T15:40:37Z","snapshot_observed_at":"2026-08-03T07:19:30.958860Z","submitted_at":"2026-06-04T08:11:12Z","title":"Learning Geometric Representations from Videos for Spatial Intelligent Multimodal Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T02:13:53.219095Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2606.05833"},"observation_digest":"sha256:71eccf8d506a70c4b7af2eea793b45c925e86bba851600e3d2548dcabf43d44f","observation_id":"97f70fd8-d53f-49d8-95d7-7d4ff37a028d","resolution":{"observed_at":"2026-07-02T12:16:57.501253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2606.06476","last_updated":"2026-06-04T17:56:36Z","snapshot_observed_at":"2026-07-06T23:46:20.554117Z","submitted_at":"2026-06-04T17:56:36Z","title":"Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T02:25:30.998989Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2606.06476"},"observation_digest":"sha256:1faf9d58a456b686846c515a6a91f99bd008a03ea16abcf2ff437d9b1aff92ac","observation_id":"2ad5078d-463c-4a61-8820-64f322518b5e","resolution":{"observed_at":"2026-07-02T12:06:56.185660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2606.06891","last_updated":"2026-06-05T04:16:24Z","snapshot_observed_at":"2026-08-02T17:56:35.888517Z","submitted_at":"2026-06-05T04:16:24Z","title":"Stream3D-VLM: Online 3D Spatial Understanding with Incremental Geometry Priors","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T22:49:02.846428Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2606.06891"},"observation_digest":"sha256:a23629b4d3cd816361ce405b9a1e00da15433e4cc0697c2b98ada09d2af999e0","observation_id":"c8b7796c-cea6-4bb4-a106-b26f1bb6a626","resolution":{"observed_at":"2026-07-02T16:17:09.596982Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:0aa019634acc0d13ebf3f508b36545b01720f179c2f812e9c77aaab63978da66","observation_id":"49f4cc9a-3a38-4f48-a4cc-9fbf10a12dba","resolution":{"observed_at":"2026-07-02T21:57:25.759560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2606.11324","last_updated":"2026-07-11T14:44:40Z","snapshot_observed_at":"2026-07-16T23:17:53.174457Z","submitted_at":"2026-06-09T18:07:50Z","title":"Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T12:55:47.754632Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2606.11324"},"observation_digest":"sha256:8de2a12cf9a1eaddaa51ddc9e9f1b2f7c1dad19254ba7fcbbb2ee873b3cde0b0","observation_id":"005223eb-9046-492a-bdcc-9e2bad9af23d","resolution":{"observed_at":"2026-07-03T06:07:41.198931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2606.11324","last_updated":"2026-07-11T14:44:40Z","snapshot_observed_at":"2026-07-16T23:17:53.174457Z","submitted_at":"2026-06-09T18:07:50Z","title":"Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T12:55:47.754632Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2606.11324"},"observation_digest":"sha256:2c2620d28c12485fcbd6688817ffcda9415929a4fc50e5fe34f581c5201d6bfe","observation_id":"96c73d22-5ff5-409a-b42d-5c9ea1ff33c1","resolution":{"observed_at":"2026-06-27T13:10:56.965482Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-07-14T18:07:09.018997Z","title":"VLM-3R: vision-language models augmented with instruction-aligned 3d reconstruction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11324","last_updated":"2026-07-11T14:44:40Z","snapshot_observed_at":"2026-07-16T23:17:53.174457Z","submitted_at":"2026-06-09T18:07:50Z","title":"Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-14T18:07:09.018997Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2606.11324"},"observation_digest":"sha256:1c71765cc4f13ccb84c635928637092fd0aee7342d3aa7cb52354b3866e8960b","observation_id":"769b4eb0-af1d-4d83-9d63-b66266a758b5","resolution":{"observed_at":"2026-07-14T18:07:09.018997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2606.11568","last_updated":"2026-06-10T01:49:55Z","snapshot_observed_at":"2026-08-04T08:35:21.350482Z","submitted_at":"2026-06-10T01:49:55Z","title":"4DP-QA: Scalable QA for 4D Perception in Vision Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T10:56:34.577237Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2606.11568"},"observation_digest":"sha256:bc7c2fe957ff294dff7d8fcc491bb926723b7f500391f43fada4caca54fc0661","observation_id":"ebd187e6-062b-4691-82ef-abcb8fe59e2c","resolution":{"observed_at":"2026-07-03T08:17:45.089423Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2606.11719","last_updated":"2026-07-29T11:18:42Z","snapshot_observed_at":"2026-08-04T21:44:41.103713Z","submitted_at":"2026-06-10T06:49:21Z","title":"Ouroboros-Spatial: Closing the Data-Model Loop for Spatial Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T10:26:51.429436Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2606.11719"},"observation_digest":"sha256:83c55475d611e497c67d9af2cbdb2ef0fecde86edc94222d3f9fe51bdf12e521","observation_id":"176e599f-f951-4c2f-b405-889d38af0ada","resolution":{"observed_at":"2026-07-03T09:17:48.664257Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-02T11:51:33.410398Z","title":"VLM-3R: Vision-language models augmented with instruction-aligned 3D reconstruction.arXiv preprint arXiv:2505.20279, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11719","last_updated":"2026-07-29T11:18:42Z","snapshot_observed_at":"2026-08-04T21:44:41.103713Z","submitted_at":"2026-06-10T06:49:21Z","title":"Ouroboros-Spatial: Closing the Data-Model Loop for Spatial Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T11:51:33.410398Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2606.11719"},"observation_digest":"sha256:2979d6224fd717428d1e704c7b02e5e2735c6a3599d9c8b75b6c3bf157d852c8","observation_id":"4736f1a5-253d-44b8-aeaa-f8ed487e9985","resolution":{"observed_at":"2026-08-02T11:51:33.410398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2606.23557","last_updated":"2026-06-22T16:28:11Z","snapshot_observed_at":"2026-08-05T01:24:53.186762Z","submitted_at":"2026-06-22T16:28:11Z","title":"Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T08:38:46.044079Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2606.23557"},"observation_digest":"sha256:0acbf163ca699ab477ff4beeb2d78f9250d98a5739c4e0b445c6bb08e2604f66","observation_id":"ecf77e8a-a6be-4908-aff0-fa8ba5799aed","resolution":{"observed_at":"2026-07-04T10:39:45.344628Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2606.23565","last_updated":"2026-06-22T16:31:48Z","snapshot_observed_at":"2026-08-03T00:44:37.135935Z","submitted_at":"2026-06-22T16:31:48Z","title":"HoloAgent-0: A Unified Embodied Agent Framework with 3D Spatial Memory","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T08:27:15.889885Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2606.23565"},"observation_digest":"sha256:d707f2afda79ef022b700554e7e5324bb0dbc9b03e71b286c3919595d0e65a1c","observation_id":"1520916c-287b-4dee-8ae8-afd507451ec0","resolution":{"observed_at":"2026-07-04T10:49:46.507869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-07-12T05:16:19.750976Z","title":"arXiv preprint arXiv:2505.20279 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03043","last_updated":"2026-07-03T07:33:28Z","snapshot_observed_at":"2026-08-02T22:57:10.179879Z","submitted_at":"2026-07-03T07:33:28Z","title":"Natural Language Camera Movement Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T05:16:19.750976Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2607.03043"},"observation_digest":"sha256:32d0d631295996489364a3729952a0b47ab5d50b12a978ee0ef5980f76d74cb4","observation_id":"019ffe8c-56e7-4c01-8659-fb28a604c152","resolution":{"observed_at":"2026-07-12T05:16:19.750976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Vlm-3r: Vision-language models augmented with instruction-aligned 3d reconstruction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":157,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:979ba445a50dad299aaa8313d43c6d85cb64733a6e16a685eca96cc2eb4d1d7d","observation_id":"29d6508d-02ce-49ee-b531-beff7c611609","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-02T05:13:00.188880Z","title":"Vlm-3r: Vision-language models augmented with instruction-aligned 3d reconstruction.arXiv preprint arXiv:2505.20279,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13454","last_updated":"2026-07-28T06:55:44Z","snapshot_observed_at":"2026-08-03T09:30:04.003236Z","submitted_at":"2026-07-15T05:27:37Z","title":"GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T05:13:00.188880Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2607.13454"},"observation_digest":"sha256:d5527474f25e0278b36a94a2a0a60fe70bf73054a132e9a78b2c6209500edc4e","observation_id":"b5130446-0bca-45bf-bbb3-b20c569965ec","resolution":{"observed_at":"2026-08-02T05:13:00.188880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-02T00:23:01.277839Z","title":"Vlm-3r: Vision-language models augmented with instruction-aligned 3d reconstruction.arXiv preprint arXiv:2505.20279,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-02T09:38:56.901727Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.277839Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:8ca384bb75de1bc10346072944274658cd01ed57c047167695625e514ad83c8a","observation_id":"3a027346-4e82-4a16-966d-da6358e1aa4e","resolution":{"observed_at":"2026-08-02T00:23:01.277839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-01T18:40:13.176413Z","title":"Vlm-3r: Vision-language models augmented with instruction-aligned 3d reconstruction.arXiv preprint arXiv:2505.20279,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17243","last_updated":"2026-07-19T13:24:40Z","snapshot_observed_at":"2026-08-05T14:53:30.971684Z","submitted_at":"2026-07-19T13:24:40Z","title":"LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T18:40:13.176413Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2607.17243"},"observation_digest":"sha256:ae9d13150dba6114ed6980fd9a8588fcd5bd362f39c433f0239c5cce1baacd3c","observation_id":"16e7b789-74c0-470a-b4fb-88a0ae418c67","resolution":{"observed_at":"2026-08-01T18:40:13.176413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-01T17:36:37.411186Z","title":"arXiv preprint arXiv:2505.20279 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17599","last_updated":"2026-07-20T06:40:45Z","snapshot_observed_at":"2026-08-05T01:59:04.488846Z","submitted_at":"2026-07-20T06:40:45Z","title":"ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T17:36:37.411186Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2607.17599"},"observation_digest":"sha256:2c28634e2c0fd4e9668f26fef6185cd945c022c325954cea0d75bc9caa5688d0","observation_id":"3fa0a7a7-c2fc-46e4-9139-d2db48040c5a","resolution":{"observed_at":"2026-08-01T17:36:37.411186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-01T16:32:47.404785Z","title":"Vlm-3r: Vision-language models augmented with instruction-aligned 3d reconstruction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17977","last_updated":"2026-07-31T13:34:17Z","snapshot_observed_at":"2026-08-05T22:21:49.793119Z","submitted_at":"2026-07-20T14:13:27Z","title":"RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T16:32:47.404785Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2607.17977"},"observation_digest":"sha256:f1a6852dd8373079ca72fd14bbeb64c919df4203f8c833a0071bb6b606b750fc","observation_id":"88ca5a98-8e67-494d-91a3-64c1160421e3","resolution":{"observed_at":"2026-08-01T16:32:47.404785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-03T01:57:28.855191Z","title":"Vlm-3r: Vision-language models augmented with instruction-aligned 3d reconstruction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17977","last_updated":"2026-07-31T13:34:17Z","snapshot_observed_at":"2026-08-05T22:21:49.793119Z","submitted_at":"2026-07-20T14:13:27Z","title":"RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T01:57:28.855191Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2607.17977"},"observation_digest":"sha256:ded5202371561a58690afa5f7e1809b5e6c3de50d44b26d8d8d8e4638a2b63eb","observation_id":"c9f46a6b-c319-4bc8-8a57-883213c90388","resolution":{"observed_at":"2026-08-03T01:57:28.855191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-01T09:09:24.856306Z","title":"VLM-3R: Vision-Language Models Aug- mented with Instruction-Aligned 3D Reconstruction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-05T04:10:26.863024Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.856306Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:597e6f18d0ca5ad23f7dac326cbf845c2b37540164038a68d35ce0ae947a22d0","observation_id":"b57eb1c8-c706-43c6-9117-8cb5704b1a7c","resolution":{"observed_at":"2026-08-01T09:09:24.856306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-01T08:39:37.227319Z","title":"Xingyu Fu, Yushi Hu, Bangzheng Li, Yu Feng, Haoyu Wang, Xudong Lin, Dan Roth, Noah A Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:37.227319Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:3486d42295f9c28919914558ad60c817c92a6fdb0389e6fcb3857e986f3c2352","observation_id":"21c8bbc7-3954-478e-bafd-bb833e4922bd","resolution":{"observed_at":"2026-08-01T08:39:37.227319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20279/citation-record","integrity":"/paper/2505.20279/integrity","json":"/paper/2505.20279/citation-record.json","paper":"/paper/2505.20279"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6b8755cd-8eec-4159-b095-df33ab84a442","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:0760f33d479545181f9576934e0874870f284ffca5c6bca46deb570becb2cc8e","observation_id":"288cff19-520e-4cfa-b0d2-7c93e1465652","resolution":{"observed_at":"2026-05-19T13:02:19.416499Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Specificity of learning: Why infants fall over a veritable cliff.Psychological Science, 11(4):290–295","venue":null,"work_id":"2d387fcb-281d-46c5-a1e1-5e6730b395e4","year":null},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:edf36296064bae533815de207d532f13e19f63a0a5bb5af63bc2d23ed220d8ed","observation_id":"d2fc3e26-dbaa-4493-a5a5-8f78ac1cf3e8","resolution":{"observed_at":"2026-05-19T13:02:19.395095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"68cc56df-f9e1-447e-9c67-fe000c1d4166","year":2022},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:e848b3e13e827f9744341f220dd0cb76c93b4e0ea74a25ecb0bc8b49bf1b9910","observation_id":"e7e5e756-a79e-4fb7-b8ed-ef4fbfbbfd6b","resolution":{"observed_at":"2026-05-19T13:02:19.390471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"eff2cd09-8c30-48d0-89c1-514321b48512","year":2022},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:36f9cca39c376325662ee1b544752067cc378e888be09debfb36b5dce5a7409a","observation_id":"639cbea1-0a31-4838-af80-3f66b605261b","resolution":{"observed_at":"2026-05-19T13:02:19.370909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:fd984fec70a46bbcae76b1eea98f81e47349a7a6883d0c7a5dca465aebfda0c7","observation_id":"6ce9edef-0c4f-464a-9457-60fab7defb66","resolution":{"observed_at":"2026-05-19T12:57:17.946057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:bfbcd7a62325bf7dcf39c3a174aa80bf21535b94aaa8507b9229c5fc6a00dc18","observation_id":"af1f33da-af6b-41b8-8518-180d7e997bc4","resolution":{"observed_at":"2026-05-19T12:57:17.937834Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:401bea8bfefee865057009d016dad23e8eb981ae7dd297fd5ff856be06e81c1e","observation_id":"f4be9339-441c-49d9-a6de-86ce00b5b57c","resolution":{"observed_at":"2026-05-19T12:57:17.971216Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08897","last_updated":"2022-01-12T08:19:29Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-17T04:27:01Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","version":3},"cited_work":{"arxiv_id":"2111.08897","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.08897","snapshot_observed_at":"2026-07-04T06:19:37.435697Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","venue":"cs.CV","work_id":"0ce910be-ca1c-44c7-b7b1-c5353759d85e","year":2021},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2111.08897","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:14913c4fcac984253fef23187f2a6e581d0764d4dd5ea144e48d90ae36d5c423","observation_id":"7df4d349-4fbd-4a94-b5af-b136e2a2bd04","resolution":{"observed_at":"2026-05-19T12:57:17.979751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00948","last_updated":"2025-05-19T16:21:18Z","snapshot_observed_at":"2026-07-06T15:21:57.592347Z","submitted_at":"2023-05-01T17:09:33Z","title":"Large Linguistic Models: Investigating LLMs' metalinguistic abilities","version":4},"cited_work":{"arxiv_id":"2305.00948","doi":"10.48550/arxiv.2305.00948","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.00948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large linguistic models: Analyzing theoretical linguistic abilities of llms","venue":"arXiv (Cornell University)","work_id":"86965a2c-5156-434f-a4bf-10708c2456f3","year":2023},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2305.00948","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:ccd7f82e3a35280707dda52f5922b2f31b995a1b32da83658a29e2ab3c65cb76","observation_id":"ed22b408-5285-4d4d-a914-e5c3bcf60c0c","resolution":{"observed_at":"2026-05-19T12:57:17.919160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are few-shot learners.NeurIPS","venue":null,"work_id":"bb1937cd-ad86-45ab-ba97-edb52e033bef","year":2020},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:eef059040c2b1782e20bcd709a57adf659674d917304e60453ac4bfbb9ec3d37","observation_id":"982e7e28-d815-48d4-9b1e-1abb639db716","resolution":{"observed_at":"2026-05-19T13:02:19.283045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatialvlm: Endow- ing vision-language models with spatial reasoning capabili- ties","venue":null,"work_id":"a5023fa7-2a66-4779-8447-94aa3e6564f8","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:d708c0dfec538271c3e91f679a4467657c71e45720935a74fd1f988dcbfcd2c9","observation_id":"db9b0fdf-6b0e-419c-98d0-760af2ad7471","resolution":{"observed_at":"2026-05-19T13:02:19.280271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning","venue":null,"work_id":"0eb40bdf-eedc-4d16-88bf-0df20b105aa7","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:05fac12b6b8908f51c4edaf5e5e122207b09e669bc0bccdbf850307a1aa11c98","observation_id":"76bdf84f-f44b-44b6-bead-d5983a2b7160","resolution":{"observed_at":"2026-05-19T13:02:19.277972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longvila: Scaling long-context vi- sual language models for long videos.arXiv","venue":null,"work_id":"4b44a88f-c459-44cc-85ed-3bff8f888094","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:4f989c073c8eda2c59dae94e7820853286997b6eb5e32461e9a1939763ff91d6","observation_id":"4a38ee90-8e7a-4a1b-be44-bb4fedba1558","resolution":{"observed_at":"2026-05-19T13:02:19.275426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.Science China Information Sciences, 67(12):220101","venue":null,"work_id":"2b877eeb-1eae-493d-a112-aeb4ce5d39c6","year":null},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:7b2d1bf0ccc0c8a2ae1ea3a40077bdee0f831dce2725eac27abba38a0b0d1d77","observation_id":"0ec60a93-f700-414b-b19c-533701813241","resolution":{"observed_at":"2026-05-19T13:02:19.450434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"d199e076-7ac5-4bfb-a3d1-969e659a06d7","year":null},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:74cc994358a195ec6eea40b1f46b3bacffa458a1389e0909998edd836db7f48d","observation_id":"fc7d53ed-46b1-451f-b050-68c2c4a909f5","resolution":{"observed_at":"2026-05-19T13:02:19.447169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatial- rgpt: Grounded spatial reasoning in vision language models","venue":null,"work_id":"acc09ef8-9809-43c8-90b1-9fbc4eba325d","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:67128f9cf4fcfee56bf946c8b7f70dd62a97cf9500e7a9ca5a98c210c85853e0","observation_id":"6180e137-9b41-42aa-b94d-628554fc5bda","resolution":{"observed_at":"2026-05-19T13:02:19.444453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":"a45a91b0-21d7-4989-92eb-60fc8131f6a2","year":2017},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:3b1b358782762f14e38779f06c4cb8dbdf7c3f136033a95dfa7db62a392919f4","observation_id":"2c7c9a71-c1c5-4a81-b5bd-50c603d98855","resolution":{"observed_at":"2026-05-19T13:02:19.441733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d-llava: Towards generalist 3d lmms with omni superpoint transformer.arXiv","venue":null,"work_id":"e03c0acd-0a40-443f-ac98-ec002fd2e90d","year":2025},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:1dbc3249ff4266bd06b2ee0eba657078292a085f4908b4242e25ec911f6c1349","observation_id":"e2097ed8-b3b4-4820-8212-72a6f32c502a","resolution":{"observed_at":"2026-05-19T13:02:19.439059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Palm-e: An embodied multimodal language model.arxiv","venue":null,"work_id":"fa75ca89-0259-4d13-9243-843dc572b7cc","year":2023},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:f8ffd81d980af1c1437fb7328cb3067e7c729187b453e282b6e870eef95f19a4","observation_id":"26ba6bdf-b15c-4173-86e0-16b7abba719e","resolution":{"observed_at":"2026-05-19T13:02:19.435994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large spatial model: End-to-end unposed images to semantic 3d.Advances in neural information processing systems, 37:40212–40229","venue":null,"work_id":"a6592a76-0077-45cb-8415-69ea289b3a89","year":null},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:ccc24a41a01c50c2852ee60f0c8843d555c4897d5f02e268800a318be064a523","observation_id":"91cc8df9-50c0-4aff-adee-bdc9dd7bf212","resolution":{"observed_at":"2026-05-19T13:02:19.433172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":"2405.21075","doi":"10.1609/icwsm.v17i1.22209","metadata_source":"pith","pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":"cs.CV","work_id":"77fd5ac9-ae98-4846-9d83-e9c73c8f2a52","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:dcdba80a1f7ecad076f3a8aebf2e613c5d23e8b8cb7153d4f199a0b8912ba38d","observation_id":"7c163f6c-01ff-40f3-8fbc-9329d33b7fa5","resolution":{"observed_at":"2026-05-19T12:57:17.965601Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"f2bd3e0f-47fe-46e4-9c94-19560ae729f0","year":2025},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:3b229029b20155a66df8679ef304761ae31bcb5f554cb83a729dc48b556c9dce","observation_id":"f35a9cfc-7b31-49b3-85b6-8d2168020559","resolution":{"observed_at":"2026-05-19T13:02:19.430621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f4e6b29c-3eb3-4bee-861e-ac9e294cd499","year":2011},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:f0aabd281aa31eff69b79b55709a1ea41103d9351393561e7bfc226299c0a8be","observation_id":"ddd3158c-4c61-43b6-bba2-fb0f62201ce4","resolution":{"observed_at":"2026-05-19T13:02:19.428030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"e197a495-061d-4740-ad8e-4164afcbbd29","year":2017},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:6bcd8d71a97893dba894d926aaee83b130b73c40cdcef369c02dd5623d6a6b23","observation_id":"b22ee976-8d20-40a3-be7e-7adab94fe5e0","resolution":{"observed_at":"2026-05-19T13:02:19.425555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cascade cost volume for high-resolution 9 multi-view stereo and stereo matching","venue":null,"work_id":"7813d0f8-8d2d-4546-a4d6-e00a0ba7942b","year":2020},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:fc4458a874eecb25d69eb5355258a014ed199760ac4ab5f96b9b649e5849a50a","observation_id":"eef2d304-8096-4309-a9d5-7da150b0f885","resolution":{"observed_at":"2026-05-19T13:02:19.422187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T08:54:49.718815Z","title":"Cambridge university press","venue":null,"work_id":"2f1a3935-3836-4bf9-9025-8ff65df7e783","year":null},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:a69827188ba569de9be974b5ed0ef052da554063ab0d62379eb0d7c3f8ccaaeb","observation_id":"b56cf3a5-89bd-42f3-b48f-6e0a5385f393","resolution":{"observed_at":"2026-05-19T13:02:19.419449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Individual differences in spatial abilities.The Cambridge handbook of visuospatial thinking, pages 121–169","venue":null,"work_id":"2f8f100c-705d-43a9-88ed-ed11e5a83903","year":2005},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:cc2f0436f409c22c040da19543afe9d76fef6fb96229442b7d7ccd518f53a5df","observation_id":"e7b214bc-6fd8-4003-9ebc-9130ae929dcd","resolution":{"observed_at":"2026-05-19T13:02:19.414137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:c0d58b13eebf1a495e87bf46427bfb399b3186cebf08380cbac4698f10ccc077","observation_id":"85ac9295-25a7-4836-aacc-09ec91d410e5","resolution":{"observed_at":"2026-05-19T12:57:17.976699Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d-llm: Inject- ing the 3d world into large language models","venue":null,"work_id":"f9538d25-d291-4572-8213-88f07c62bc91","year":null},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:1c15c2a4cde5f2d72473dc8dd46aeff86520945a51d5ccfdeb7371df2d473a53","observation_id":"b959b21d-cfcc-4970-a531-70beba8b3ee1","resolution":{"observed_at":"2026-05-19T13:02:19.411041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multiply: A multisensory object- centric embodied large language model in 3d world","venue":null,"work_id":"c2f1c939-2215-4c59-bcb4-ad3d2e1cec4f","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:b4cb96bff6f0f31da489f1557121b52477cd0cef9dd605fae911098977e9051d","observation_id":"8956cff6-dc7b-4017-8ecf-7489da190266","resolution":{"observed_at":"2026-05-19T13:02:19.407256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3","venue":null,"work_id":"2a4c9260-71cf-4cb9-bd47-8f4380f85444","year":2022},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:4f95b08eade13c660e4c8a1db38e35252eb59d681283efeb434bfb9ddd0262f3","observation_id":"0b072315-f3a0-41d2-80b2-c8005b6f7366","resolution":{"observed_at":"2026-05-19T13:02:19.404467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":"d6459d10-0ebf-45f8-8c54-5a30d950abca","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:256f9cb0333c863b25d5ad10de5932b47ca56378e01e316030ca58c8ed80e3dc","observation_id":"a36efbde-83f7-4cc1-945c-3f65fe7e747c","resolution":{"observed_at":"2026-05-19T13:02:19.401520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Think- ing in dynamics: How multimodal large language models perceive, track, and reason dynamics in physical 4d world","venue":null,"work_id":"8ecdefbd-cb38-4bf3-9e27-0a086d2cf780","year":null},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:d6c2d1814978f28fe610df48c6ddf750e9cbb77270f04022abb0adaaffbc08c5","observation_id":"7c3fa2df-ace9-4161-b619-cff13a410cf1","resolution":{"observed_at":"2026-05-19T13:02:19.398597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4o system card","venue":null,"work_id":"fd552679-0b58-43b4-8a68-8608b19208b9","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:4eef6884d4d9312b4e872a9309dcfe8df1641b133124a85b3fc6520080cfdfd4","observation_id":"13b7a12b-88d9-40d8-9b2c-d6b87400b72e","resolution":{"observed_at":"2026-05-19T13:02:19.392838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:3ac736aadd708159cfeade1ffec23de7ec58f59e2704977f51f9804fe4b1518d","observation_id":"176b21c4-a32a-48e2-82cd-5929fbabfabf","resolution":{"observed_at":"2026-05-19T12:57:17.934955Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"5331c2c3-676b-44f4-81af-b85ac4680955","year":2021},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:20ce20f901a8d6c8325cca8b8919e6a04c67b1aa62a045d25cd85369c431c21b","observation_id":"2c14db9d-9c5f-49d7-afa7-dfbbafa5de74","resolution":{"observed_at":"2026-05-19T13:02:19.387705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models with rationality","venue":null,"work_id":"bbb007fc-3ad0-4d41-8649-52656adf45d9","year":2023},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:f4fd88da8f6e8f4622d2a49dc9c19d6a7f5d5ea345c7d89a9758547fb7864791","observation_id":"2397de9d-ad86-46d4-bfd0-59f3ea0cdc34","resolution":{"observed_at":"2026-05-19T13:02:19.384751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ground- ing image matching in 3d with mast3r","venue":null,"work_id":"002e257a-1102-4951-84c7-31d579a86224","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:f8bb46a46436b84a4ddcf8a0217243ab49e4527a7c8fbd7501ee6f900a2d4b83","observation_id":"92002432-7ab6-4ae7-9617-0f8d134f234f","resolution":{"observed_at":"2026-05-19T13:02:19.382302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:762d505fb5167300033b4923284093089d657dbe34e2ca7810c28ae0274c5e20","observation_id":"e1fb0817-cae5-436a-b16c-0832312d0733","resolution":{"observed_at":"2026-05-19T12:57:17.951456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":"c548a015-407c-43cf-bd39-9e8e8607e347","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:84d751a924c66c087f0ffabd9b85db06bb5283588f18b3b36b4003d12d63465e","observation_id":"a0edd5e1-3abc-409c-9775-a45302aaebb2","resolution":{"observed_at":"2026-05-19T13:02:19.379855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"9c4fe003-d0f0-4f5d-a836-3b2ea9135d55","year":2023},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:016ea218766a415e2434d383196f7b458d3608d5ac761d676d693cc87c65360f","observation_id":"a92127dc-e1d9-4520-a9f7-5fd2aafb18a4","resolution":{"observed_at":"2026-05-19T13:02:19.377361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"0d098252-2b85-4331-845a-b0323fa17601","year":null},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:0ef7ce4c74032f16bcf7ea197181d195d6ec763d46eb4ec30e1b6d9979e4abe1","observation_id":"4c4ae958-d758-4598-99ea-ad5c82545015","resolution":{"observed_at":"2026-05-19T13:02:19.374251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"0e5e6116-86c7-47d7-8b2c-900366802256","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:2b79ea9ff44bb402fb8ca6a417ffe87fe137ebfcb72ac852fee2ed4a012b4081","observation_id":"3b714487-2121-435b-a022-cf9295b61b17","resolution":{"observed_at":"2026-05-19T13:02:19.368407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.07984","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T01:27:30.587936Z","title":"Ost-bench: Evaluating the capabilities of mllms in online spatio-temporal scene understanding","venue":null,"work_id":"ca782bad-f2ab-48af-9cca-a30e5aebf8e2","year":2025},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:f4a827958deed200ac536fd70bdfa32c7523040debe7d9ee349437bace0b3736","observation_id":"4f9fc90f-956d-4066-bb00-6a7ff5f040e0","resolution":{"observed_at":"2026-05-19T12:57:17.928522Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning.NeurIPS","venue":null,"work_id":"b41573ea-e6d2-42a3-bad8-560308fe94e8","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:8108a1a3458b0c5f224bd6139cf686fe42418173915d91025096465bd132e62b","observation_id":"4946b5cd-c496-47bd-9de3-29f191b7d7eb","resolution":{"observed_at":"2026-05-19T13:02:19.366087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":"2409.12961","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-07-04T13:09:50.847114Z","title":"Oryx mllm: On- demand spatial-temporal understanding at arbitrary resolution","venue":null,"work_id":"4a905ca2-7426-40db-a509-3452624d3ae5","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:296f54e87d815abd5df525b795c61cbf487282423f6deb05ad906b7a66c9f811","observation_id":"c77b11ea-bf67-4cfe-b28a-8fe3ed3e4a48","resolution":{"observed_at":"2026-05-19T12:57:17.995688Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.arXiv","venue":null,"work_id":"51fc951f-489c-4633-9097-85fe0f43b8ee","year":null},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:7211df9da3bf856cc87b9a41d93b66b17184e775adde4ef73c38b104a02a9860","observation_id":"c2108898-ca17-4368-9202-129e1c1152ea","resolution":{"observed_at":"2026-05-19T13:02:19.363730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-07-06T14:05:02.813765Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:f8b00f4a633f41c8dfe0e99c811a7ce0a95e23d87afc8dac19692ae3b74af5a9","observation_id":"c627b4dc-78c6-4e8b-a85c-543e476b10c9","resolution":{"observed_at":"2026-05-19T12:57:17.925336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openeqa: Embodied question answering in the era of foun- dation models","venue":null,"work_id":"b5e8329e-550f-40fc-883c-823ad9d4f002","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:392df1dce955f20c44d1b50ec1761b36c2f77358f010a81c2510c4eb46ef0e20","observation_id":"f927bbe9-841f-456f-bae3-1d998d683bdc","resolution":{"observed_at":"2026-05-19T13:02:19.360925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.07491","doi":"10.48550/arxiv.2506.07491","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa- tiallm: Training large language models for structured in- door modeling","venue":"ArXiv.org","work_id":"27acceee-c061-4f76-8ef8-952546a10adc","year":2025},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:68133af6009e5839a063f9e60c9dedc15de25500946a382737dbc5afb9243bc2","observation_id":"9d43534f-83a9-4cf0-bd8e-23df09169d75","resolution":{"observed_at":"2026-05-19T12:57:17.932334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How are the locations of objects in the environment represented in memory? InInternational conference on spatial cognition, pages 174–191","venue":null,"work_id":"52daf59e-c76c-4af9-bb36-04747d977c82","year":2002},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:09463f37fc3dae40f333a8c2df7ae1f310ed183f6a395f2a3c04269c4c6c0a5a","observation_id":"b5736758-3f31-4fac-a9f7-e3333cedabde","resolution":{"observed_at":"2026-05-19T13:02:19.358474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Individual differences in navigation: an introductory overview.Prime archives in psychology","venue":null,"work_id":"01f8b61d-4db9-4bc0-b5a1-7810d175001f","year":2022},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:e808a4bd05d9707eef3fadb96133eb180a230ac8282d05fdc23194e36b139d2d","observation_id":"19b0647b-b903-4de6-877a-00fbe927077d","resolution":{"observed_at":"2026-05-19T13:02:19.355982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mast3r-slam: Real-time dense slam with 3d reconstruction 10 priors","venue":null,"work_id":"f6b7a66f-3807-4ba6-8907-1ef898e92923","year":2025},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:245f8cfb6090aae74ff1310bb6c4bdd721edc074e8042f05e3dedefe32ba13b2","observation_id":"283d2cf4-5cc5-4656-8047-51b32808da02","resolution":{"observed_at":"2026-05-19T13:02:19.353271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"cited_work":{"arxiv_id":"2307.06435","doi":"10.48550/arxiv.2307.06435","metadata_source":"pith","pith_arxiv_id":"2307.06435","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Comprehensive Overview of Large Language Models","venue":"cs.CL","work_id":"8b633537-f91b-4c1f-9f24-809d928bc39c","year":2023},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2307.06435","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:6c12730f64626bb2d923a633eacfe4412a3a04a004347dcff1613260e2d9c542","observation_id":"c43ae4d9-456b-4dae-a9f5-b21879f2b106","resolution":{"observed_at":"2026-05-19T20:28:39.632097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kosmos-2: Grounding multimodal large language models to the world.arXiv","venue":null,"work_id":"455a23a8-326d-49bd-8b43-55993987b28b","year":2023},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:3bb0aa03ac32b4866fe6741777a9252ea9ea9158c8204d510ed1d002689a5d58","observation_id":"f66ca052-d8d4-409a-8fbb-064208529145","resolution":{"observed_at":"2026-05-19T13:02:19.350951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving language understanding by gener- ative pre-training.OpenAI Blog","venue":null,"work_id":"6e850843-926f-4e8b-9d05-aff242bfbcf7","year":2018},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:27a25829cea95c7a461f2d1fdaea6ce7dbd1e918bac2cca9b12de4c52951f530","observation_id":"f580f4c9-297d-4e79-9d3e-64ccb0abde5f","resolution":{"observed_at":"2026-05-19T13:02:19.348497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are unsu- pervised multitask learners.OpenAI blog, 1(8):9","venue":null,"work_id":"a303e62c-5e52-4dab-befd-218d194c56bf","year":2019},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:9a6a70a5693323c6819475c62a452d4bc68febdc526089a25db67ab79d7fdaab","observation_id":"06d58fa1-eea7-43f7-92a0-5d7737e15429","resolution":{"observed_at":"2026-05-19T13:02:19.345965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T11:32:22.336259Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"a33e7050-0881-49b7-95ff-ef370f49bd09","year":2021},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:5483246726bf3eac21b900d49584906ff371963f2a82bcd3769f56fef0fb11c3","observation_id":"1be725fc-8a8f-42d8-b96d-a4ba772a9216","resolution":{"observed_at":"2026-05-19T13:02:19.343196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Habitat: A platform for embodied ai research","venue":null,"work_id":"c865f7d1-6bf6-4293-bd47-26d63984e435","year":2019},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:f94c89ee54ee4d34c7fdd642f22aa4f796276b25eb57e5aafdcfb8acb504cdba","observation_id":"f9af211a-6592-49ff-9c64-2a7ff77b0f6e","resolution":{"observed_at":"2026-05-19T13:02:19.340296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Structure- from-motion revisited","venue":null,"work_id":"5e1130da-5ea0-4a3b-8bf7-94a93adb3248","year":2016},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:ce53a12f85e48624464ce2263920122415637af5afdd768f575638e383d6a657","observation_id":"ab55bd1e-d896-4e6b-be9c-7d65a3ea14a1","resolution":{"observed_at":"2026-05-19T13:02:19.337960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06974","last_updated":"2024-12-09T20:34:55Z","snapshot_observed_at":"2026-07-06T20:04:15.943803Z","submitted_at":"2024-12-09T20:34:55Z","title":"MV-DUSt3R+: Single-Stage Scene Reconstruction from Sparse Views In 2 Seconds","version":1},"cited_work":{"arxiv_id":"2412.06974","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06974","snapshot_observed_at":"2026-07-01T19:16:00.876128Z","title":"Mv-dust3r+: Single-stage scene reconstruction from sparse views in 2 seconds","venue":null,"work_id":"5bbd6f96-f9a8-44bc-aa8a-8644a1ac9c46","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2412.06974","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:1038baa23b60580fd17ab5e783d2f4ba5657f147ac96fc97021eed98c22c1142","observation_id":"d76d7748-9158-4771-b9a3-69c86b2fb3be","resolution":{"observed_at":"2026-05-19T12:57:17.954380Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:a699c293846825a7b656bcc4cbe0cbb2b46d23dedec2ae4b27b2c23ec590551d","observation_id":"dcb81cea-be14-4721-9888-3d547935b109","resolution":{"observed_at":"2026-05-19T12:57:17.948707Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text.arXiv","venue":null,"work_id":"51c6adf3-2f99-4d8a-8673-a17d06b57be9","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:f2aba87b20e97d94d186313d1bbe78d3bcacd109d39078fe119e53657ec78da4","observation_id":"a1ec1067-4ff1-4553-917d-b4d1fd4a3d83","resolution":{"observed_at":"2026-05-19T13:02:19.335354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:761c7663599e8eb1ecf2c7574e20a1f2bb7dfdb2efcf678e9c2e2a98b0fabf95","observation_id":"2d0dd26b-8296-47f4-9ccb-fc0c0eba4d91","resolution":{"observed_at":"2026-05-19T12:57:17.959632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:7de6542b18c1a683d79cfa3174f4522b833fb4e28c8580de0e18092b57d5310a","observation_id":"a48a28e7-5e0c-45b7-b853-3485cc1dc09a","resolution":{"observed_at":"2026-05-19T12:57:17.974006Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9e8017ea-81de-4b9a-b579-3fc76a3762c1","year":2013},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:2f8b9c5e98f86c625c333740b3bd2b88e95c2fe275502be047fdda7792dadee4","observation_id":"a08a204b-1749-46f7-adf6-aac496c39be1","resolution":{"observed_at":"2026-05-19T13:02:19.333007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16061","last_updated":"2024-08-28T18:01:00Z","snapshot_observed_at":"2026-07-06T19:07:20.444206Z","submitted_at":"2024-08-28T18:01:00Z","title":"3D Reconstruction with Spatial Memory","version":1},"cited_work":{"arxiv_id":"2408.16061","doi":"10.48550/arxiv.2408.16061","metadata_source":"pith","pith_arxiv_id":"2408.16061","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D Reconstruction with Spatial Memory","venue":"cs.CV","work_id":"5d192969-560a-44a0-b0d1-6f8af326ea84","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2408.16061","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:6ab1aa697eb82cd79aa68afeb70e344c3e500191f2ac3e017d1e605065f5e506","observation_id":"03683f5f-842f-4921-9417-097cfe935b31","resolution":{"observed_at":"2026-05-19T12:57:17.998536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01901","last_updated":"2025-04-02T16:59:55Z","snapshot_observed_at":"2026-07-06T21:03:11.554376Z","submitted_at":"2025-04-02T16:59:55Z","title":"Ross3D: Reconstructive Visual Instruction Tuning with 3D-Awareness","version":1},"cited_work":{"arxiv_id":"2504.01901","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.01901","snapshot_observed_at":"2026-07-04T16:39:57.809937Z","title":"Ross3d: Recon- structive visual instruction tuning with 3d-awareness","venue":null,"work_id":"d3ba3e21-3bf6-414c-840c-1d39858fe7f0","year":2025},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2504.01901","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:eb79a0a5fd825e0e4016080be8637b0a0efd648c8fdf6b1bd1e82532853144fa","observation_id":"8bfcbaab-93bb-47aa-a2c7-679f23797e2e","resolution":{"observed_at":"2026-05-19T12:57:17.982684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11651","last_updated":"2025-03-14T17:59:47Z","snapshot_observed_at":"2026-07-06T20:52:55.699004Z","submitted_at":"2025-03-14T17:59:47Z","title":"VGGT: Visual Geometry Grounded Transformer","version":1},"cited_work":{"arxiv_id":"2503.11651","doi":"10.48550/arxiv.2503.11651","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.11651","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vggt: Visual geometry grounded transformer","venue":"ArXiv.org","work_id":"c49e0f28-20d8-4ff4-9683-568363c784e2","year":2025},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2503.11651","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:50ec30bb0d2545628b93328bc2be9da03eedea67b1a53e88d4ef9fa542145b05","observation_id":"2f1d1b15-0de5-45ac-8c0a-daec510929df","resolution":{"observed_at":"2026-05-19T12:57:17.992322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on large language model based au- tonomous agents.Frontiers of Computer Science, 18(6): 186345","venue":null,"work_id":"ba651945-20b4-4784-b6d2-9178c2ce125e","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:0c4f04f20f83fa011ec83bdefee18b8edcf3dc84abaf346cea69ef6f8074e785","observation_id":"5d5fcb24-c093-4280-a9a8-5134bfc89e16","resolution":{"observed_at":"2026-05-19T13:02:19.330759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","venue":null,"work_id":"f5790f33-89d2-4815-a307-c9a9648bbe38","year":2022},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:9310e20c6534b5db300ee117e8d87afc78da204d275d4d00887e37a11849bd8f","observation_id":"6867501f-769a-4719-a96c-8430b0beb986","resolution":{"observed_at":"2026-05-19T13:02:19.328176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12387","last_updated":"2025-01-21T18:59:23Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:59:23Z","title":"Continuous 3D Perception Model with Persistent State","version":1},"cited_work":{"arxiv_id":"2501.12387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12387","snapshot_observed_at":"2026-07-01T19:16:00.367749Z","title":"Continuous 3d perception model with persistent state","venue":null,"work_id":"8d986612-4394-40fe-9f03-67dc1da1fad8","year":2025},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2501.12387","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:1de51bfc062a84e3607059122901270776263c7577a7326f721abe2725951e73","observation_id":"7f4afd21-f9f3-41f2-9cd6-eedb231e61ca","resolution":{"observed_at":"2026-05-19T12:57:17.957147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dust3r: Geometric 3d vi- sion made easy","venue":null,"work_id":"c1b320ef-a4bd-4a75-aaa3-cf366e4fe90c","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:fd222d63ba3e3d9f20b87199d25a8e27534842fc703dfa18d028a8a5bdef7e23","observation_id":"62118cfe-8cf9-414d-a5b3-bf7c7510b21f","resolution":{"observed_at":"2026-05-19T13:02:19.325908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emergent abilities of large language models.TMLR","venue":null,"work_id":"705b1083-986d-4c89-b9a3-33b6de81c70e","year":2022},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:0fd36009ef668f1bb4242787c564340b925954c42a543bc25db0389826764b39","observation_id":"b87f94a7-a7f7-455e-a5ca-bb963b40f335","resolution":{"observed_at":"2026-05-19T13:02:19.323032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.03000","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamicverse: A physically- aware multimodal framework for 4d world modeling","venue":null,"work_id":"37c102cf-8d69-4f1e-b3b5-58574863e437","year":2025},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:16e1f1744a1474f0bf87bcd8ad9a6b9a4855286e7d27db987dd12c2d29fccb9f","observation_id":"464c7c19-7436-4453-817f-9704be2f3139","resolution":{"observed_at":"2026-05-19T12:57:17.943520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":2},"cited_work":{"arxiv_id":"2505.23747","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23747","snapshot_observed_at":"2026-07-04T16:39:57.786059Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","venue":"cs.CV","work_id":"389bb6a7-1369-4d6f-a808-838fa4f5b635","year":2025},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2505.23747","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:65c63de5b8570e2fdf2012668010f059b146963177b3f5b93efcdca4e846b05b","observation_id":"075cb424-c74a-4abc-b2a4-31ba790d8c5d","resolution":{"observed_at":"2026-05-19T12:57:17.988712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":"2412.14171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-07-04T06:29:37.915954Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","venue":"cs.CV","work_id":"bbaf0f51-258a-4d79-b5a4-5b1e9120b2c0","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:50880801489a17f5c2ea721f179a72c63a31c4c4da9355f248db2cf0eeacb1a3","observation_id":"381d89a9-f92c-435a-80ea-61ed73fb442d","resolution":{"observed_at":"2026-05-19T12:57:17.916212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13928","last_updated":"2025-03-19T19:35:52Z","snapshot_observed_at":"2026-07-06T20:25:08.527025Z","submitted_at":"2025-01-23T18:59:55Z","title":"Fast3R: Towards 3D Reconstruction of 1000+ Images in One Forward Pass","version":2},"cited_work":{"arxiv_id":"2501.13928","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13928","snapshot_observed_at":"2026-06-30T16:54:59.263569Z","title":"arXiv preprint arXiv:2501.13928 (2025)","venue":null,"work_id":"926b9b2f-e6e8-40a2-8816-ceea11d1d49d","year":2025},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2501.13928","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:e0ba50cccf12ce07a6738f54f337e5ea873ea28bb9032fa6a5d828cea195dc3e","observation_id":"f2f7711f-1566-4c1b-ae81-9b1467a86c9f","resolution":{"observed_at":"2026-05-19T12:57:17.962691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mvsnet: Depth inference for unstructured multi-view stereo","venue":null,"work_id":"4f9381d6-81d3-4c77-9e29-3ac459c9760d","year":2018},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:5de0f88429533a678e2446ccf54ad3e2c788949da6fbb2af41075db194daf60d","observation_id":"7c0e173d-c1f5-406a-a593-ae4c0d7b5607","resolution":{"observed_at":"2026-05-19T13:02:19.320163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scannet++: A high-fidelity dataset of 3d in- door scenes","venue":null,"work_id":"ff5f4f3e-772f-4195-b1ba-6bc312c4cf02","year":2023},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:cb6cbbbc31759ff66667f3c67ef05eaba32722498e6e4946265fe46a90151c9a","observation_id":"0ec9e627-5adf-4b66-b74c-86fbda9ac8b7","resolution":{"observed_at":"2026-05-19T13:02:19.317225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"4ae4ff94-7cd0-46cc-8ff0-2e54c4bc573b","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:0f293ee2aa16ac14fdd329e7078c48d7281501263b6a525b9b80d2cd389afa9f","observation_id":"04289116-dcf4-4568-9715-6b70ce94f633","resolution":{"observed_at":"2026-05-19T13:02:19.313956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03825","last_updated":"2025-05-08T08:32:16Z","snapshot_observed_at":"2026-07-06T19:28:08.374354Z","submitted_at":"2024-10-04T18:00:07Z","title":"MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion","version":2},"cited_work":{"arxiv_id":"2410.03825","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.03825","snapshot_observed_at":"2026-07-04T21:00:08.933119Z","title":"MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion","venue":"cs.CV","work_id":"eb8020a2-8be2-40c3-92cc-0feca979f95e","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2410.03825","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:247d6bdea6470e030d98e6364ded1600933168eb9a93bde4740c35f3e6069211","observation_id":"2bdd7e1f-26f0-429c-95fe-e645d9aab789","resolution":{"observed_at":"2026-05-19T12:57:17.921894Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatialstack: Layered geometry-language fusion for 3d vlm spatial reasoning","venue":null,"work_id":"01978b55-f128-4011-a8ba-07e1a95585fc","year":2026},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:d324f3da03456b5af40f524cb5811d2162454a09f289429ee8eb981272d76665","observation_id":"af60ba3e-af7f-46ec-887c-445a66aa29be","resolution":{"observed_at":"2026-05-19T13:02:19.311221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Long context transfer from language to vision.arXiv","venue":null,"work_id":"aa77bc2a-0829-4aa3-b00f-7ad90bc35dd2","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:a064e4891200299b98bb0f14aecafbf04eb05ee9dfdb0783fa66f1f1806f0193","observation_id":"0ca71d35-d57a-46c1-b31b-74d6af952ada","resolution":{"observed_at":"2026-05-19T13:02:19.308776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava- next: A strong zero-shot video understanding model","venue":null,"work_id":"de0aaeea-feee-4d9b-9cfd-9f19f965755e","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:7e8e2c501964344f83023b6932239527b0c46a30aa47d1639c2a6789cdb175e1","observation_id":"cc288160-2790-4e00-b581-d2b03553eec8","resolution":{"observed_at":"2026-05-19T13:02:19.306070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":"2410.02713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-07-09T21:36:34.348434Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","venue":"cs.CV","work_id":"e598f516-d992-449a-ab6d-6c788b3a1d7b","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:68ab73034acf40609aa0dacf48bdc862d87558a7d1acad6d78171500c39e3931","observation_id":"9f3976c4-30c8-426f-a89b-b2cd0d54fcb2","resolution":{"observed_at":"2026-05-19T12:57:17.940393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unveiling linguistic regions in large language mod- els","venue":null,"work_id":"bf8193f8-f14f-491d-9d5d-2fa38c21cfcd","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:a1b7db056f4517547baebf3ef690acc3dbe41c4bbded6a9f404969d051a953eb","observation_id":"7fc8ac22-0502-4f8b-832c-97fea333e413","resolution":{"observed_at":"2026-05-19T13:02:19.303448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-3d llm: Learning position-aware video representation for 3d scene understanding.arXiv","venue":null,"work_id":"a100b2fd-ac45-4528-94ad-301efe91fe2c","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:c48a0875c609341abeecbebabe23ec79a7dad1e9170b4b1f67ca7635cc37db37","observation_id":"0e73a075-a863-4f68-ac5a-18f3ac68fd2f","resolution":{"observed_at":"2026-05-19T13:02:19.300884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.24625","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T20:16:29.422789Z","title":"Learning from videos for 3d world: Enhancing mllms with 3d vision geometry priors.arXiv preprint arXiv:2505.24625","venue":null,"work_id":"dd7bade9-d1d4-4597-8176-7cf017bedbd8","year":2025},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:9cb644940223d46760ef832655825cf2521356e6d187ec272cde522508d816ab","observation_id":"1afbfa50-2e6b-4cf1-8682-475436557316","resolution":{"observed_at":"2026-05-19T12:57:17.985781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-3d llm: Learning position-aware video representation for 3d scene understanding","venue":null,"work_id":"97915fd7-a295-492d-9082-f9a73a3d88f9","year":2025},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:d7223a9d0df45e1d493c160a71ca27609382e5f71b6123f99f3e6ed86ecff931","observation_id":"d4efdad9-bc2c-491b-8bea-7585c10c65a9","resolution":{"observed_at":"2026-05-19T13:02:19.298301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:01:40.257784Z","title":"Feature 3dgs: Supercharging 3d gaussian splatting to enable distilled feature fields","venue":null,"work_id":"6eec3d30-4b8e-4bc1-8378-6a569627af37","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:5c8bd9a846b0302b7f214bffa9e590bb461e96a819be2ae1bc623643ce2edfa5","observation_id":"30577fc6-a5f6-4ed3-9ead-8dac2f83a044","resolution":{"observed_at":"2026-05-19T13:02:19.295076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Feature4x: Bridging any monocular video to 4d agentic ai with versatile gaussian feature fields","venue":null,"work_id":"1b7a0918-b91d-4099-9335-e12d5e468f07","year":2025},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:e4f5d7b40e7fbaa5bd896e739ed240a1327051e067b7841ba3bdc30a82c4debf","observation_id":"7e33c036-c44a-4149-b231-72d3b52bb796","resolution":{"observed_at":"2026-05-19T13:02:19.292195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlm4d: To- wards spatiotemporal awareness in vision language models","venue":null,"work_id":"5186b5a6-409e-4f5c-b5c5-1b1954058a1c","year":2025},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:70907b9753610b01ca63f19f987bf4e30226455765599ae0da11fbf8c57427d0","observation_id":"7367b6aa-65a0-4729-a323-d1b27d74bcf5","resolution":{"observed_at":"2026-05-19T13:02:19.289863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness.arXiv","venue":null,"work_id":"55975757-4e93-43e5-9e16-295d19b1c9e2","year":2024},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:2a037438d3161cd0550b2761bbd0959dcc6bcef8a32dcc973c25b6157aede020","observation_id":"1cfd3034-3377-453c-950e-c1aff81858b6","resolution":{"observed_at":"2026-05-19T13:02:19.287629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"cut3r\"). •Spatial tower feature selection:all (-spatial_tower_select_feature","venue":null,"work_id":"82c84af2-b1f3-496a-a923-84c8ec2f6681","year":2023},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:860cdb5b0a2eacc6a44e3fad40f1292bcdb7331e934e7e904937222e92ac8da7","observation_id":"c92deb70-9b8e-4a07-971f-6e7b8f9ad8d1","resolution":{"observed_at":"2026-05-19T13:02:19.285410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction"},"reference_resolution":{"displayed":95,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":29,"verified_fuzzy":63},"total_outbound_references":95},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 71 inbound Pith citation observations for arXiv:2505.20279."}