{"as_of":"2026-08-07T23:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5098904ce623e5ce576a24998d66f7f1f3007782f3da742b302879cecd4a5954","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T07:00:06.887909Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.05493/citation-record","integrity":"/paper/2607.05493/integrity","json":"/paper/2607.05493/citation-record.json","paper":"/paper/2607.05493"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Referit3D: Neural listeners for fine-grained 3D object identification in real-world scenes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:ae5157b8730d6169a42c0d9b732e2abc13ffe4c846ba91ca03069f6a88681a07","observation_id":"7fbfe4f1-87ff-4aa8-8c15-5e1d3f471fb9","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Kestrel: 3D multimodal llm for part-aware grounded description","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:8232f48f8c4a8c3e481b0e4862ead1ff46aa9f255f6e6ad7cea9307bcfade3a9","observation_id":"aeaa3a1f-3ccd-4e7d-94ec-798e8059b9da","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Scanqa: 3D question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:578e90e948a9343bb1bd5d6e83d26d4413fd60c1a4c128cd49341f7c46c8e390","observation_id":"6ff0dec0-4444-4f76-b510-2d7a63ad383a","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:4c16ed8d3f95f4eb534dcdfd06fb13b79d2fe6d77a94d70b38f7845834a91413","observation_id":"34211933-6998-4e76-a3bd-26e464b8d146","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"OPEN-YOLO 3D: Towards fast and accurate open-vocabulary 3D instance segmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:287ac350a56617ab2be1e77e6caef845ef3bcef0ef895a066379ceb2c9451967","observation_id":"c7f4a444-f0c1-4339-bc21-687174d5f48b","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:7dec0d68f8a20becbb5287db9accfeaf959bd3505a4a18dbd9be2d2a6ad4c78d","observation_id":"914028de-8979-4a28-b8fb-a6d0b3cc3d7f","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Scanrefer: 3D object localization in rgb-d scans using natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:132d3ccded541305b7a69609863791d26730e4d5a8be66350be8b8be6f0a2e6a","observation_id":"8e053c2d-1e81-4acb-9c22-26d7145cab6f","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"SD-VLM: Spatial measuring and understanding with depth-encoded vision-language models.arXiv preprint arXiv:2509.17664, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:91954702647dde2c77bd6565bad4467f9e8e0c3f4d55c2a6b6003e3eb64625f0","observation_id":"a6a11c7d-6ac9-447d-9978-fc376cba04b5","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models.Advances in Neural Information Processing Systems, 37:135062–135093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:4d15ff727e31209f318c407d89c9d47434254ec15d2b44f25fecf18082126732","observation_id":"38952829-d990-4a0a-9986-0d2c01dd6aed","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"4D spatio-temporal convnets: Minkowski con- volutional neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:8c937503c24938e123ad0ba5d731b5a313552e26b10495f8c5a448157decb1bd","observation_id":"2e67eb86-6367-47a2-b529-8eb5951d43ec","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Spconv: Spatially sparse convolution library","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:f7e1900fee65ed4d640dd40c3fec69e1efd8e089e0919ae34f8a5f9eed20bf2d","observation_id":"8c073c39-2917-48b2-93cc-e3e4fabb1f38","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Scannet: Richly-annotated 3D reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:43f4a281fd617981b9c6fc212a1900ce5da4ecf84297cecb7588893a8e52b3d1","observation_id":"3e4fa938-8774-4d12-8ee8-3d1a06e055da","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"MM-Spatial: Exploring 3D spatial understanding in multimodal LLMs, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:b968fd2350413df3d293877d4aff67268293c817571e133843e050211c3a6916","observation_id":"e9acc02d-1a39-4c47-8ecc-a457ecd8206c","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Segpoint: Segment any point cloud via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:9ee1b986e3b2551fdbea6a2698b4186ff77058d5a15ac817a713dd7594f5a884","observation_id":"98b77c19-369c-4b00-b1b4-bef3da8a232a","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:1e8b81e892402e8fb76788f7e781b103332fba81c63c382a07915a9580c3dd92","observation_id":"976c6dc2-04d9-456c-9766-ec30e1edb0bc","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"MLLM-For3D: Adapting multimodal large language model for 3D reasoning segmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:dfd95ecd8380c549506af07ece45eda2378ad6cf135c547aeeab162e00bb6938","observation_id":"2d057c75-08b0-4d00-ad4f-1f5d805b3197","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17427","last_updated":"2025-02-09T07:32:21Z","snapshot_observed_at":"2026-07-06T18:20:44.070255Z","submitted_at":"2024-05-27T17:59:41Z","title":"Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17427","snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Reason3D: Searching and reasoning 3D segmentation via large language model.arXiv preprint arXiv:2405.17427, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"cited_paper":"/paper/2405.17427","citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:1100b2cc1f812f83d0bb896f7ccba07a38a21e14d29954ffadc48c7cd9e0f7b6","observation_id":"08dc9d04-6e6d-420a-917d-7d861e367414","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Text-guided graph neural networks for referring 3D instance segmentation.AAAI, 35(2):1610–1618, May 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:523f2f404cce6c4eab7ce4a90f8af7ff8b5e0e297e206626e0244272e4da7538","observation_id":"2a9e9ebc-7251-4165-a5d4-ba9a5895d877","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Openclip","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:75d84c8b34330fbdc54cce7184eb0cfef933c8ed8476148b4bc90f1ef546ba54","observation_id":"121cd119-b855-4d3e-bb9e-b68161e39acd","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08879","last_updated":"2022-07-21T05:25:39Z","snapshot_observed_at":"2026-07-06T12:19:33.825116Z","submitted_at":"2021-12-16T13:50:23Z","title":"Bottom Up Top Down Detection Transformers for Language Grounding in Images and Point Clouds","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08879","snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Bottom up top down detection transformers for language grounding in images and point clouds","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"cited_paper":"/paper/2112.08879","citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:22c627811aca0d17b3b08974069ffc237b4bd9725bc4abe00fd7f5b9d4469b12","observation_id":"4bfbc7c2-6861-42b0-bfcd-6a24fc56eae7","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18295","last_updated":"2025-02-17T23:10:49Z","snapshot_observed_at":"2026-07-06T18:21:22.569625Z","submitted_at":"2024-05-28T15:48:39Z","title":"Intent3D: 3D Object Detection in RGB-D Scans Based on Human Intention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18295","snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Intent3D: 3D object detection in rgb-d scans based on human intention.arXiv preprint arXiv:2405.18295, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"cited_paper":"/paper/2405.18295","citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:310980512922e6d62bc6e1f15ef037f99873021093bfe2d56a1c587fae691ab8","observation_id":"dfa662b9-857b-47f9-9c2f-ff9efc8b8e46","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Paris3D: Reasoning-based 3D part segmentation using large multimodal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:c4368ace3de2ca6ccf44bb8192dbb52c5a2c713f880875a46f23e6104ff5b35b","observation_id":"522528e5-b386-4a05-9928-bed4dee7463c","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Seeground: See and ground for zero-shot open-vocabulary 3D visual grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:93f9005c47d715bc6ccaa9edffd6c820d9e4b812d1fd443b18332ac81b989a35","observation_id":"fb73473c-1e89-4159-a653-447a6e8293c3","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Instance segmentation in 3D scenes using semantic superpoint tree networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:3a435029b777e3bdcd3685d17862b84300e0be4e5af2e6beffd3cdabd78c09ee","observation_id":"f2dba8c2-9b2f-4e5c-905f-d8398ba08bc4","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Partslip: Low-shot part segmentation for 3D point clouds via pretrained image-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:c64062b25b4d582df16b4db4f56ba28899532f4b52ea905992e536293df258bc","observation_id":"23742aa8-b1fc-4079-8d91-e5bdf64636e4","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:21f7493a1fc908241d6f17962c3ef6e632267ff66b2843365793fd54c54fab9a","observation_id":"a4f03636-dedf-4b50-ad3c-140accd43848","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"SQA3D: Situated question answering in 3D scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:a0ee0fd07f8e0d7efa0b17995a14aee450d434afc47e268c74b4067e256b8e77","observation_id":"68461a9c-4313-416c-819c-3f923628fa31","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03426","last_updated":"2020-09-18T01:56:41Z","snapshot_observed_at":"2026-08-02T15:32:07.466568Z","submitted_at":"2018-02-09T19:39:33Z","title":"UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.03426","snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Umap: Uniform manifold approximation and projection for dimension reduction.arXiv preprint arXiv:1802.03426, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"cited_paper":"/paper/1802.03426","citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:95dd316af78dc576b7ee5a9e8b7ca4416e84986d9c444067c0073c8aa2f0eec3","observation_id":"c43534d9-1bd4-48ac-af7c-b3bd08fe0657","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"V-net: Fully convolutional neural networks for volumetric medical image segmentation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:e8dbb66324632f324a09d3f65242fac4b315df4177878971594ac5c3f714d2f4","observation_id":"134c746c-0264-4265-91ea-6905405251f7","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Open3DIS: Open-vocabulary 3D instance segmentation with 2D mask guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:c5a8495291a497f6826871d519de30be1a489e76f6f5b816f6e5ff3db12978c5","observation_id":"67aa20a1-04fb-463f-b0d6-5a8b0e6c753c","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"GPT-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:18d91e0eb239f4d13eebddcfa3fad5cca1c64b6ee990fd8269d4d96bf596f99a","observation_id":"b663a8c1-58e5-464a-bfed-082d7fbdb180","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:41f95786b4376bb31b9190314517b990483c3a274b24e3a0fe72628e7c2bbb34","observation_id":"6924e58b-26ee-4df7-8015-bd4fb938c96e","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"SAM 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:5dcd73b725c4298a3125ec5f4a9a0371d92108e41dd205cdebbcd92a55fbeeed","observation_id":"1d9b1836-1c10-48fe-a5fc-6a708f61e258","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Grounded SAM: Assembling open-world models for diverse visual tasks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:73022980948fe225cbe34e1bab7a9bcd81d566cd1756245fd118f340bf15a59c","observation_id":"fcd577b1-6a99-4d49-a00b-260eaf299601","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Efficient 3D semantic segmentation with superpoint transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:1be0245c3c971e7b420cebabbc003cdf8f8dd59e2e57e4df1a094adfbefc26d8","observation_id":"34cee88d-ba9c-4fdd-bd42-1adf04fbe1f7","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:c3b4f3539d1a5d5c728702181f8249cad16a26f6f9d4b6e2b307d0f03f7dcf51","observation_id":"a8c06fcf-11f4-4360-b6c8-8df467b95593","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"N3D-VLM: Native 3D grounding enables accurate spatial reasoning in vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:20e87ebc34a8ac2a66d28a0b7aa2e47da2442a72acef66030da732a920e9b710","observation_id":"2d7f1781-bafd-404b-a0ee-6e0997152b74","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"3D-STMN: Dependency-driven superpoint-text matching network for end-to-end 3D referring expression segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:aeb6b3b798157fd876b29a13ac53ede022c4ce62bc2a26fe5f6a6a63dea34f1d","observation_id":"2be777a8-db10-4ae9-9c3f-c5d3fcbe499f","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Eda: Explicit text-decoupling and dense alignment for 3D visual grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:7cb8307f7a279973222f8aa9a6d2f42b996d53f2cc38b0a2fa8d86b352313687","observation_id":"1b62f83b-d8b6-430e-b4f7-c58eeff41f20","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"S 2-MLLM: Boosting spatial reasoning capability of mllms for 3D visual grounding with structural guidance.arXiv preprint arXiv:2512.01223, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:a46cd69726ade267da05a9a08fa55504fac64ee38313d0aad52535a255c6a076","observation_id":"ae6b6ffb-60c6-402c-991f-5eb1c79e4ed9","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"A unified framework for 3D scene understanding.Advances in Neural Information Processing Systems, 37:59468–59490, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:53a73e6e1ad4f8cdf8f8d42812732ed497eb1c94d0c85140fbd4110a3006a739","observation_id":"d2ec79d2-ff44-4537-83a3-bce9439fcbee","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Scannet++: A high-fidelity dataset of 3D indoor scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:4cc890fcf43c8a8b8ec851683b7596d43b2f20d8a48638f37320c4d5e8412b4b","observation_id":"7ea99656-2dfd-4f80-85a3-1fea28f37b01","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Inst3d-lmm: Instance-aware 3D scene understanding with multi-modal instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:18a384a11124aa87b947ed1069caa2ebdc639e769909332ef5d628dce29c944f","observation_id":"2d9cc1e1-f181-4eda-9b4f-1f5aaf81c375","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"Instancerefer: Cooperative holistic understanding for visual grounding on point clouds through instance multi-level contextual referring","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:96f330ba508d77f0344ac4645b451e0da70ae8b2b2a9ea3594830c3182365af9","observation_id":"7b862ed8-e7f5-4655-a5f5-687f0eff9bc3","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"MM1.5: Methods, analysis & insights from multimodal LLM fine-tuning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:d25ff836b1c16af520ea15ec5cd366586846f4a445201030dfc826b9cb9c5bb9","observation_id":"d7de9d14-5f50-4c0d-9d27-06052a9dc791","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"near the door","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:1140b3b7432bf657d5a977305d7eea7a10ebe5010d26b69038411d47a980cd43","observation_id":"5d50611d-7e06-45a9-88e9-7348aebd6b9d","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:aa50400633edb45f2a438811ceab2c5728d38d089f9863badc95c1cce910f4bf","observation_id":"c9cd55b6-8fbb-436f-9b59-c70159c17ddc","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:6c374e21c28f5367ffea1d106cae6e660c78dccc024ba6860ebdfd7d5d0461c6","observation_id":"71b033a4-c645-42a8-97fe-a39b0c7ae8e9","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:00:06.887909Z","title":"to the left of the table","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T07:00:06.887909Z"},"links":{"citing_paper":"/paper/2607.05493"},"observation_digest":"sha256:1b47f6663e8c181ba40c5492b729864433974c0e7b8bf2114276994943771ed1","observation_id":"be97dda2-7df4-4469-917a-062517815351","resolution":{"observed_at":"2026-07-11T07:00:06.887909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.05493","last_updated":"2026-07-06T18:00:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T02:45:39.194735Z","submitted_at":"2026-07-06T18:00:00Z","title":"Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":47,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2607.05493."}