{"as_of":"2026-08-09T16:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c5e507d32c58ad970bf1c0dc89af0005b62039535e13db9868e5d84436b80128","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T13:46:30.742617Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2512.23020/citation-record","integrity":"/paper/2512.23020/integrity","json":"/paper/2512.23020/citation-record.json","paper":"/paper/2512.23020"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:24.639077Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:24.639077Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:50c050eeceba0b36535190eeef842fd13277f283d21ff889b2b04b2492d3288e","observation_id":"4b346241-e0e1-43ec-88bb-c7892aeca65f","resolution":{"observed_at":"2026-08-03T13:46:24.639077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-03T13:46:24.676297Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:24.676297Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:4fe89e6dd9e11dc7e28d4aa6000c68b295e761f255ccf959b1a925b48be4015e","observation_id":"7cb64a59-1787-46a4-b295-ad60e12ceb72","resolution":{"observed_at":"2026-08-03T13:46:24.676297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T13:46:24.725953Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:24.725953Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:8949e4aba3379b6eb57c7e4adcf90cc0fc62c8a3f301bfe6efb68cf5fc51bfa5","observation_id":"55fef07d-a12e-4b20-8630-3ea9ee537b29","resolution":{"observed_at":"2026-08-03T13:46:24.725953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08897","last_updated":"2022-01-12T08:19:29Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-17T04:27:01Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08897","snapshot_observed_at":"2026-08-03T13:46:24.796692Z","title":"Arkitscenes: A diverse real-world dataset for 3d indoor scene understanding using mobile rgb-d data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:24.796692Z"},"links":{"cited_paper":"/paper/2111.08897","citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:7ad91713011069b2929930eba7db5f9ccb1c0d8d5c4697ab0e25589c2735f4d2","observation_id":"313e7e72-8f17-4ead-8cf0-73b5e44adc38","resolution":{"observed_at":"2026-08-03T13:46:24.796692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:24.853650Z","title":"V olcengine, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:24.853650Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:46a66d4dd2dc41c1a8b1005c3f33e20b4af99515079a0500766829a073d60bbc","observation_id":"1ea61447-7beb-4efd-b01a-dfde39e94a8e","resolution":{"observed_at":"2026-08-03T13:46:24.853650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:24.916811Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:24.916811Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:09523ffbf436bdfaf28eed3a17cd8da5ec697195278302b9955b05152226d361","observation_id":"1e65dbb5-7e34-4f5f-8fff-e0fc2d88a324","resolution":{"observed_at":"2026-08-03T13:46:24.916811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:24.997144Z","title":"Clip2scene: Towards label-efficient 3d scene understanding by clip","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:24.997144Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:d9aa6713b09039f0a0bb16786ef3acbb3bd9c77d2dce982b7162dd5dccabedfe","observation_id":"365da19f-3f5b-44f5-a20d-e35d17c5ccec","resolution":{"observed_at":"2026-08-03T13:46:24.997144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:25.071306Z","title":"Internvl: Scaling up vision founda- tion models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:25.071306Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:e7776dad98540ecf7bb843c9371af0dd0da4c5ca2cc08dfacc6aa9a927f21995","observation_id":"5105a9ff-fdc1-4b41-9095-839b7250849b","resolution":{"observed_at":"2026-08-03T13:46:25.071306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:25.129168Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:25.129168Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:ef60e907dd0dfb4ac3f501ca401edf36fe738f35d9853b6cbb189a856705aba9","observation_id":"0ff6566a-fc14-4ad6-b5c3-323be97cdb00","resolution":{"observed_at":"2026-08-03T13:46:25.129168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:25.187733Z","title":"Text-guided sparse voxel prun- ing for efficient 3d visual grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:25.187733Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:5b2226e32a97c69d26f9a61d60961f9a9b874bc8ebff0c34d68d6b7fe54faff8","observation_id":"46ad6a8a-70b9-49da-b652-3cc48b0672d0","resolution":{"observed_at":"2026-08-03T13:46:25.187733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01398","last_updated":"2025-07-02T12:33:12Z","snapshot_observed_at":"2026-07-06T20:00:09.775334Z","submitted_at":"2024-12-02T11:33:55Z","title":"Articulate3D: Holistic Understanding of 3D Scenes as Universal Scene Description","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01398","snapshot_observed_at":"2026-08-03T13:46:25.254469Z","title":"Holistic understanding of 3d scenes as universal scene description","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:25.254469Z"},"links":{"cited_paper":"/paper/2412.01398","citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:680c3724706be2f8b62fd498e79518195b044cc622f81ad4346aeba52f536731","observation_id":"79ffd427-3678-4b2a-8168-4a7734fab0cf","resolution":{"observed_at":"2026-08-03T13:46:25.254469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.05714","last_updated":"2023-03-08T10:30:41Z","snapshot_observed_at":"2026-07-06T14:03:49.583141Z","submitted_at":"2022-10-11T18:13:20Z","title":"Visual Language Maps for Robot Navigation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.05714","snapshot_observed_at":"2026-08-03T13:46:25.397049Z","title":"Visual language maps for robot navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:25.397049Z"},"links":{"cited_paper":"/paper/2210.05714","citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:756b2c650e574100a7c56b4262cce5f7996a17a9c7319e50ee325c3aeebc9cae","observation_id":"aba550f1-ed45-4a81-abaa-ad820e307ae1","resolution":{"observed_at":"2026-08-03T13:46:25.397049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:25.547384Z","title":"Viewsrd: 3d vi- sual grounding via structured multi-view decomposition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:25.547384Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:beabc813e490760ff94d931248781397ff8731a8d159d410cfece29b60595e6c","observation_id":"d8f4c378-cc0b-43cc-9bca-b2f04d685a82","resolution":{"observed_at":"2026-08-03T13:46:25.547384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:25.615188Z","title":"Real-time object detection meets dinov3","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:25.615188Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:02e1c2ac947c0badb06a58e9355643fd2c2ae0246a1e5ed68f9226d2037f3bb7","observation_id":"ae655177-e249-4e1d-a798-b8d92ac04e86","resolution":{"observed_at":"2026-08-03T13:46:25.615188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23478","last_updated":"2025-07-31T11:59:06Z","snapshot_observed_at":"2026-08-07T03:56:49.161093Z","submitted_at":"2025-07-31T11:59:06Z","title":"3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23478","snapshot_observed_at":"2026-08-03T13:46:25.731371Z","title":"3d-r1: Enhancing reasoning in 3d vlms for unified scene understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:25.731371Z"},"links":{"cited_paper":"/paper/2507.23478","citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:278ba31e6b90ad0a43cd8582bcac0d4457809886da127831c2de6c19b9538e7e","observation_id":"0cdf0053-1cc4-41c5-a688-a9bc2a70ff88","resolution":{"observed_at":"2026-08-03T13:46:25.731371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:25.801754Z","title":"Assister: As- sistive navigation via conditional instruction generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:25.801754Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:e8b4baee4498b7a7e7c3ffcbc7f2c226f72f1878f1f2d06478a8c280ffe00a50","observation_id":"3d8791ce-1010-443c-b94b-10369b914744","resolution":{"observed_at":"2026-08-03T13:46:25.801754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:25.845804Z","title":"Bottom up top down detection transform- ers for language grounding in images and point clouds","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:25.845804Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:1bddb9d41ffbe53fc2823bc725d79feb568a384558cb6fb625a93ae273b2df97","observation_id":"4376230b-4c53-4e26-a8f6-b0ff8ffbf535","resolution":{"observed_at":"2026-08-03T13:46:25.845804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:25.912211Z","title":"Pointgroup: Dual-set point grouping for 3d instance segmentation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:25.912211Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:e85541d55cd8d099f1ecce65de17177e636a49b9c4a09fb44c34784ac9a1c27b","observation_id":"0ea278d1-3707-465b-9906-d3296915f07b","resolution":{"observed_at":"2026-08-03T13:46:25.912211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:25.960605Z","title":"Spazer: Spatial- semantic progressive reasoning agent for zero-shot 3d visual grounding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:25.960605Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:1d700bd7f47d6782600f008da2aa644dc47679a7406a946e833cb17537c8c6ee","observation_id":"8d28f72c-da0d-45f4-bbc5-e6f807603ee0","resolution":{"observed_at":"2026-08-03T13:46:25.960605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-03T13:46:26.060718Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:26.060718Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:127e5dfe1e5813c70281080277bd1c03f0d63aa6bf87198333e174c0ef400bd3","observation_id":"94f518d9-4b48-49ab-802d-b24c4340eb6e","resolution":{"observed_at":"2026-08-03T13:46:26.060718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:26.160300Z","title":"Robo3d: Towards robust and reliable 3d perception against corruptions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:26.160300Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:8f9d6c1ef068cdc53b515bcfc76daa2e85e976afc2c966d48e99a620820b093b","observation_id":"2060021a-bdac-4969-9613-d3b9a9a896d4","resolution":{"observed_at":"2026-08-03T13:46:26.160300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:26.184051Z","title":"Binary coors capable or ‘correcting dele- tions, insertions, and reversals","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:26.184051Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:9b020a8b47a1e462ff514c1b0ba4f0ff58e5315cbc025e76fcbdf633dd07f579","observation_id":"9869603a-e889-42c3-9a27-33295ed45466","resolution":{"observed_at":"2026-08-03T13:46:26.184051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:26.351052Z","title":"Cityanchor: City-scale 3d visual grounding with multi-modality llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:26.351052Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:10c4839b05520800f7d7935a6b6009d2bc8dd8c2441455837bc423d5b761a318","observation_id":"9daaeccf-04d9-44ef-8393-d9f33e95ee1a","resolution":{"observed_at":"2026-08-03T13:46:26.351052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:26.509898Z","title":"Seeground: See and ground for zero-shot open-vocabulary 3d visual grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:26.509898Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:74e82d4c72d9816909ac2c95c6c2081be35ea6e0128ca1babef1fe1cac3bd8b0","observation_id":"0aa3d14f-4e59-4823-883b-658530d8641d","resolution":{"observed_at":"2026-08-03T13:46:26.509898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:26.629243Z","title":"Seqvlm: Proposal- guided multi-view sequences reasoning via vlm for zero- shot 3d visual grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:26.629243Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:087f8ee117bff4ca7012d9fe11817a761971511752c3219c3409120279756d4d","observation_id":"aebef689-f72b-4ddc-8853-94e5b34d856d","resolution":{"observed_at":"2026-08-03T13:46:26.629243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:26.799701Z","title":"Groundflow: A plug-in module for temporal reasoning on 3d point cloud sequential grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:26.799701Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:b5845234aac82ecbe3326dac8c045f71ec43af7b98d56c9971efc8ca767b9488","observation_id":"9e22817d-c8bc-4075-b897-a3ae1548164a","resolution":{"observed_at":"2026-08-03T13:46:26.799701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:26.973422Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:26.973422Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:0a2fe8eb0fb3431a5881689b61d4b0fb402b180c73bc5c75dfef6cf9f9a678a0","observation_id":"dc85aebc-4eba-4633-b6fc-e820d97724f9","resolution":{"observed_at":"2026-08-03T13:46:26.973422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:27.091001Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:27.091001Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:27a716661c5bb465d1296de92208c0ce9d08f9cdb20a9558dffea8e5cbd04521","observation_id":"4f273e61-c111-4dfc-83c1-c1dc8b131b5c","resolution":{"observed_at":"2026-08-03T13:46:27.091001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:27.233532Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:27.233532Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:60e8de45d8e174723bc2b6bd53bb96e04664f0b3e121cdb4ae2e77f81a4b53da","observation_id":"625178ca-ae18-4280-b076-d97ccc34447b","resolution":{"observed_at":"2026-08-03T13:46:27.233532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-03T13:46:27.376732Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:27.376732Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:3708ef009148068cbdaeadbb3209b5c254384bbfa77c8b2d1fe4c90556e74363","observation_id":"dcca793a-e749-461c-8723-89250657945e","resolution":{"observed_at":"2026-08-03T13:46:27.376732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:27.593660Z","title":"Aligning cyber space with physical world: A comprehensive survey on embodied ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:27.593660Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:c8ce84f3f7437a4994b1ca1979c3c1db736a515357c39ea90195aa746f458c8a","observation_id":"0436e47e-bb4e-443f-af38-a90c8ec9db68","resolution":{"observed_at":"2026-08-03T13:46:27.593660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:27.638770Z","title":"Group-free 3d object detection via transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:27.638770Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:fbd0544c7a0117939de8d3d4a0c913807613adeb3dbad3e52bd571480846eb2c","observation_id":"609dd445-8d22-4c7d-a296-3472a44a633b","resolution":{"observed_at":"2026-08-03T13:46:27.638770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:27.714644Z","title":"Rea- songrounder: Lvlm-guided hierarchical feature splatting for open-vocabulary 3d visual grounding and reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:27.714644Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:216431924eb878b9d5a0ec033d7c800548091e6bfe35a2a5dbb32246342887f4","observation_id":"7ad903ff-af64-4bf5-ae6f-cd74ad7cce1f","resolution":{"observed_at":"2026-08-03T13:46:27.714644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10509","last_updated":"2024-03-30T16:09:14Z","snapshot_observed_at":"2026-08-09T11:02:13.623704Z","submitted_at":"2023-08-21T06:50:29Z","title":"An Examination of the Compositionality of Large Generative Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10509","snapshot_observed_at":"2026-08-03T13:46:27.883179Z","title":"An examination of the compositionality of large generative vision-language mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:27.883179Z"},"links":{"cited_paper":"/paper/2308.10509","citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:13a2fe232bd37b2999fab776870fd257a281cfc159810e6b76cf77dac08be296","observation_id":"61b1d477-c84d-4d3e-9fb2-c3ae3b292bad","resolution":{"observed_at":"2026-08-03T13:46:27.883179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:27.983279Z","title":"A guided tour to approximate string matching","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:27.983279Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:36408e2a69102346b15af572772193c695eae7d7552d4a96fce026e98ea3c1b6","observation_id":"dd930adc-d263-4ca4-9785-2d0317dbd7a4","resolution":{"observed_at":"2026-08-03T13:46:27.983279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:28.053097Z","title":"Open3dis: Open-vocabulary 3d instance segmentation with 2d mask guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:28.053097Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:a40713877a070cb474095352b4314b7f30651a8519cf28d4f285e8450c3d1ad0","observation_id":"f0860b1e-8f69-4d8c-aacb-33e8803e4aab","resolution":{"observed_at":"2026-08-03T13:46:28.053097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:28.121495Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:28.121495Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:4229215df2b2df8ecc41b3141b257671c8a9e09d8576fc890291fa62a942dc3a","observation_id":"32c978b5-73d8-4424-82b2-d4e30651184c","resolution":{"observed_at":"2026-08-03T13:46:28.121495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-08-06T23:31:17.110793Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01428","snapshot_observed_at":"2026-08-03T13:46:28.179433Z","title":"Gpt4scene: Understand 3d scenes from videos with vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:28.179433Z"},"links":{"cited_paper":"/paper/2501.01428","citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:4679c685a8f200dfaf0e8ea0f23c13e6dc0a2a4aaed0f25d983c2c5168eda7a2","observation_id":"e6481afa-a945-489a-9415-830dd543b5bd","resolution":{"observed_at":"2026-08-03T13:46:28.179433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:28.243595Z","title":"Multi-branch collabora- tive learning network for 3d visual grounding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:28.243595Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:c68518f71bd30f1ed6878a41e8f9a65b97c3618f07637e22da47ca5b95b5addd","observation_id":"9eb4c277-9824-4e43-97cb-0256e0b9ea0f","resolution":{"observed_at":"2026-08-03T13:46:28.243595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:28.297223Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:28.297223Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:b60b1054219a370f11f989290705575c07264dec61eb42b03164505f2bb2d663","observation_id":"70dc88a2-54c0-40d3-ac7d-dd9c867f6c76","resolution":{"observed_at":"2026-08-03T13:46:28.297223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-03T13:46:28.346656Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:28.346656Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:9e233118a3ca240852f89159389776ae408206b31c8f03e36ad2df0474d8512e","observation_id":"d5b20ee0-b1e6-49f0-8540-80afdd41453b","resolution":{"observed_at":"2026-08-03T13:46:28.346656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:28.393825Z","title":"Grounding dino 1.5: Ad- vance the ”edge” of open-set object detection, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:28.393825Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:f33a785acf4077837bd7f60a998dfde61f9c741297ac3121cf31c3f433dc2996","observation_id":"57964a5f-e6fc-4aef-91ef-31deb606b288","resolution":{"observed_at":"2026-08-03T13:46:28.393825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:28.424535Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:28.424535Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:18e2ccee9c02f7ae4a3a148e61aca843c7ddff1f25afd1ae61096d16be7d652d","observation_id":"32008338-e2d5-4e3f-a618-5dc97d6e26ca","resolution":{"observed_at":"2026-08-03T13:46:28.424535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03105","last_updated":"2023-04-12T09:22:53Z","snapshot_observed_at":"2026-07-06T14:01:25.012788Z","submitted_at":"2022-10-06T17:55:09Z","title":"Mask3D: Mask Transformer for 3D Semantic Instance Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03105","snapshot_observed_at":"2026-08-03T13:46:28.502891Z","title":"Mask3d: Mask trans- former for 3d semantic instance segmentation.arXiv preprint arXiv:2210.03105, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:28.502891Z"},"links":{"cited_paper":"/paper/2210.03105","citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:716164a0a1b3ed1992fff82801e3a1208a3f7b93ea04dde707572164f1943f02","observation_id":"daf0f72f-dfe0-4e2b-a1ff-767a1fdd28f1","resolution":{"observed_at":"2026-08-03T13:46:28.502891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:28.607897Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:28.607897Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:c2aaf39d3d4aee8a17d27e68b10e58901868ffd8eb0205731362668fec5d5859","observation_id":"e3503738-9962-483a-a2b3-9a578d223cfc","resolution":{"observed_at":"2026-08-03T13:46:28.607897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:28.748376Z","title":"Chain of semantics programming in 3d gaussian splatting representation for 3d vision grounding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:28.748376Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:be371f675c48726a8901bc8f042cb843cb83c21de060bbd219bb9efdc8af768d","observation_id":"a9395ac1-3912-48b4-82d0-acf97ae44f8f","resolution":{"observed_at":"2026-08-03T13:46:28.748376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:28.854787Z","title":"Scanverse: An extended reality authoring platform for in- dustrial digital twins","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:28.854787Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:58196e46e8272a86f41650c9a5907d0842dc6dc6d4fb255fbe8ee1b0dc1455de","observation_id":"3472fcdf-5afe-46c1-be4d-3509521c0783","resolution":{"observed_at":"2026-08-03T13:46:28.854787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:28.908564Z","title":"Toronto-3D: A large-scale mobile lidar dataset for semantic segmenta- tion of urban roadways","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:28.908564Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:b3c5b9f303b3d759e2f2955b6687dd94d55d18a4db9ec20d8f4166eb611df6b7","observation_id":"a6820240-1a67-4ba2-b240-7f044a4c3e72","resolution":{"observed_at":"2026-08-03T13:46:28.908564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:28.957516Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:28.957516Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:fcc4213608e4688ab3d9db1152decab16e736da5cc523f44501955953ce18f47","observation_id":"3be4b7ec-5f81-4755-833d-1eea1eb25418","resolution":{"observed_at":"2026-08-03T13:46:28.957516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:29.034955Z","title":"Step-3 is large yet affordable: Model-system co-design for cost-effective decoding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:29.034955Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:9894863ca4b034868c77908ab9bde8e573596026ad3969d434f1fde210804d7c","observation_id":"07a0aecb-96b9-4ac7-862a-76df66962e74","resolution":{"observed_at":"2026-08-03T13:46:29.034955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:29.130473Z","title":"Glm-4.5v and glm-4.1v-thinking: Towards versatile multi- modal reasoning with scalable reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:29.130473Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:aa5cb15d1fd00790221e377a12e59782dd10554f71b270f0f2071b6666c21ed2","observation_id":"cc8f7e8d-a0aa-46cc-9b4f-f250c82245aa","resolution":{"observed_at":"2026-08-03T13:46:29.130473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:29.154289Z","title":"Four ways to improve verbo-visual fusion for dense 3d visual grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:29.154289Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:704ecd24bb251dc1dc20956952a0003c0bf8dcbdb00582af226efca9528d826f","observation_id":"814571d9-400c-4c26-8d44-9d44c9a40a71","resolution":{"observed_at":"2026-08-03T13:46:29.154289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:29.223924Z","title":"Four ways to improve verbo-visual fusion for dense 3d visual grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:29.223924Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:ddae07bccd3f338eb9937316ae0beb168de92e32b0f53dc3f5806a8a31965688","observation_id":"7c244af7-a5db-4e14-b8ce-6532c0111468","resolution":{"observed_at":"2026-08-03T13:46:29.223924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:29.325058Z","title":"Softgroup for 3d instance segmentation on point clouds","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:29.325058Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:803112ae2d3df72ab1b1a829df944c3642527fd47d073f16f9552349e16aba68","observation_id":"f5708c28-47ae-43e2-9ff4-f8244763b1e0","resolution":{"observed_at":"2026-08-03T13:46:29.325058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-03T13:46:29.369610Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:29.369610Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:3fbecdd07c15028a461d35047d3d5029fa7574e469f563bec311c7eb5bdacf78","observation_id":"72d1996a-a531-4851-a608-fcfaf610fc9f","resolution":{"observed_at":"2026-08-03T13:46:29.369610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-03T13:46:29.439667Z","title":"Internvl3.5: Advancing open-source multimodal models in versatility, reasoning, and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:29.439667Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:3dd3392c19f1c7c813369c4ae8c9bf9aefe074fc0cbbb324ae7d80249c801ab1","observation_id":"045eac86-d014-4d93-aa85-b015f2ab480d","resolution":{"observed_at":"2026-08-03T13:46:29.439667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:29.489388Z","title":"Gˆ 3-lq: Marry- ing hyperbolic alignment with explicit semantic-geometric modeling for 3d visual grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:29.489388Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:0e351789b687a5fa51410ceaa347ccd38b575660ee6fb2b5169cecedc81a31be","observation_id":"6beead42-ee3b-461e-ac78-166077ee50b2","resolution":{"observed_at":"2026-08-03T13:46:29.489388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:29.550904Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:29.550904Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:c589ba26438583cd51a9eaf2bfe89fbc6682883b9c7cc636f7dc82d9d2952b1e","observation_id":"f9c39b50-f675-4731-a626-01bfe58e9bc4","resolution":{"observed_at":"2026-08-03T13:46:29.550904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:29.609114Z","title":"Vlm-grounder: A vlm agent for zero-shot 3d visual grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:29.609114Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:383ee55a2e33dfdbce21d159ba9c86b0687a79621d2d3d3aa6404f3b0724f430","observation_id":"382c87ca-ec19-4a3e-afa8-9f25ababd34a","resolution":{"observed_at":"2026-08-03T13:46:29.609114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:29.707101Z","title":"Pointllm: Empowering large language models to understand point clouds","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:29.707101Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:b83a754d29f6793b4d8748d22e9b4369cb75583c25b827ec2efaf9ac295ec8a8","observation_id":"fe98ea70-968a-4796-96d3-57bdbcdeb287","resolution":{"observed_at":"2026-08-03T13:46:29.707101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:29.770251Z","title":"Llm- grounder: Open-vocabulary 3d visual grounding with large language model as an agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:29.770251Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:949b207a1073b0bb5f7a46a211bb7066a77e0985058d54c56bb38d7bee2816c3","observation_id":"6cc2d2db-73c8-4542-ac51-40b761f4fc84","resolution":{"observed_at":"2026-08-03T13:46:29.770251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-03T13:46:29.832565Z","title":"Gupta, Rilyn Han, Li Fei-Fei, and Saining Xie","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:29.832565Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:14205467c2cede9fcaf4162c87cd62f33d300df0b3ce2118141062e2e2416f22","observation_id":"fdb310ac-5857-4264-ad30-debb3c91e2b7","resolution":{"observed_at":"2026-08-03T13:46:29.832565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:29.888749Z","title":"Scannet++: A high-fidelity dataset of 3d in- door scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:29.888749Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:25edfd484433c8b673e995832e9d22b8addef474e675d5c9b799b0f8b9782fa4","observation_id":"82175457-2fca-4ac1-bbc9-7a6120e388a5","resolution":{"observed_at":"2026-08-03T13:46:29.888749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:29.914190Z","title":"Visual programming for zero-shot open-vocabulary 3d visual grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:29.914190Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:5a80cf4b2eca497fbc140cd222ca7b7205149dad8ea33d8c3299fe76dd716495","observation_id":"71713700-8dca-4192-9004-f57fff4b2e6d","resolution":{"observed_at":"2026-08-03T13:46:29.914190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18684","last_updated":"2025-08-15T00:22:23Z","snapshot_observed_at":"2026-08-07T15:59:06.203223Z","submitted_at":"2025-04-25T20:24:11Z","title":"SORT3D: Spatial Object-centric Reasoning Toolbox for Zero-Shot 3D Grounding Using Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18684","snapshot_observed_at":"2026-08-03T13:46:29.976578Z","title":"Sort3d: Spatial object-centric reasoning toolbox for zero-shot 3d grounding using large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:29.976578Z"},"links":{"cited_paper":"/paper/2504.18684","citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:13002c35667a2dfc8bf76a31dec87fb8ce06d82be387d1f6b582eec31d6d9917","observation_id":"265e5e3c-adee-4ff5-b8a5-50ee03ade4ff","resolution":{"observed_at":"2026-08-03T13:46:29.976578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:30.037104Z","title":"Freeq-graph: Free-form querying with semantic con- sistent scene graph for 3d scene understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:30.037104Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:65dcb765ea64e1d0367ebf464405e862a22bcca74cc35e827fae8df023d61b88","observation_id":"8c9db673-f821-44de-9a2f-029057679638","resolution":{"observed_at":"2026-08-03T13:46:30.037104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:30.093670Z","title":"Multi3drefer: Grounding text description to multiple 3d objects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:30.093670Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:236d955e52b466b58f450a9cca5278920ae8f3d393f8eed51e92ca105a6712f2","observation_id":"9d4a9856-247b-4feb-a670-6463b978ce0d","resolution":{"observed_at":"2026-08-03T13:46:30.093670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:30.163068Z","title":"Prototype correlation matching and class- relation reasoning for few-shot medical image seg- mentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:30.163068Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:01401c733d78cecf38366015504f862baa40f87aadc88ebc4ce8a5dafa8a4296","observation_id":"b9a73137-451c-4659-b58b-157ebbdc473f","resolution":{"observed_at":"2026-08-03T13:46:30.163068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07035","last_updated":"2024-12-29T23:16:37Z","snapshot_observed_at":"2026-07-06T18:43:47.559289Z","submitted_at":"2024-07-09T16:53:36Z","title":"Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07035","snapshot_observed_at":"2026-08-03T13:46:30.233495Z","title":"Vision-and-language navigation today and tomorrow: A survey in the era of foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:30.233495Z"},"links":{"cited_paper":"/paper/2407.07035","citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:c3f46cce1fc41688d7ce4a3e83281de3ebbbd9ea8084c7ecd740cc2b742b6a31","observation_id":"918a850a-c282-4b16-bc5f-4a8add1d2a3f","resolution":{"observed_at":"2026-08-03T13:46:30.233495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:30.307236Z","title":"3dvg- transformer: Relation modeling for visual grounding on point clouds","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:30.307236Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:c7791d4d173631dfbf8614d05860e56f9913e764acf731dd7a7426287bd4f5d5","observation_id":"e42712d6-cb06-45aa-8643-30e1a0e2ef7c","resolution":{"observed_at":"2026-08-03T13:46:30.307236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04965","last_updated":"2025-05-08T05:49:06Z","snapshot_observed_at":"2026-08-07T15:48:55.734832Z","submitted_at":"2025-05-08T05:49:06Z","title":"DenseGrounding: Improving Dense Language-Vision Semantics for Ego-Centric 3D Visual Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04965","snapshot_observed_at":"2026-08-03T13:46:30.353680Z","title":"Densegrounding: Improving dense language-vision seman- tics for ego-centric 3d visual grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:30.353680Z"},"links":{"cited_paper":"/paper/2505.04965","citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:3f851ecaa01d506fa1eb59839b8c9ff581376823750aa86b0a8e75977cdeb020","observation_id":"81f17d1f-e9b9-44ab-bf37-731031f23fee","resolution":{"observed_at":"2026-08-03T13:46:30.353680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:30.422883Z","title":"Point-SAM: Promptable 3d segmentation model for point clouds","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:30.422883Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:9b6e567994f55e5dfad5c9c038d2d26362d2abc0e7aa629ed9c2694e3d2960f2","observation_id":"7420f87d-4a26-45cd-b82a-55daeed10fef","resolution":{"observed_at":"2026-08-03T13:46:30.422883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-08-07T23:35:09.059226Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-03T13:46:30.457026Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:30.457026Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:6225cb2c9729161b2fc72e49b728febede19b9db5e0ece3358f6799d500a8d01","observation_id":"725628d7-5b50-4f3c-9e4c-88091d41cc87","resolution":{"observed_at":"2026-08-03T13:46:30.457026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:30.520895Z","title":"Struct2d: A perception-guided framework for spatial reasoning in large multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:30.520895Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:1601fdb0f1b869483270b4b46b841e4527cdc0ac10427f8c18f67a21bbfa3e26","observation_id":"ceaeb973-e054-41e8-9cbb-b6551fc49d41","resolution":{"observed_at":"2026-08-03T13:46:30.520895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:30.657126Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:30.657126Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:18b89e1f84059dcd34981bf5e9f1454d6e1dd2beb6cf3d55733ca5ae4128c5a0","observation_id":"098fbfdd-eb2e-48db-9b07-8b01ae14249d","resolution":{"observed_at":"2026-08-03T13:46:30.657126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:46:30.742617Z","title":"Move to understand a 3d scene: Bridg- ing visual grounding and exploration for efficient and versa- tile embodied navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T13:46:30.742617Z"},"links":{"citing_paper":"/paper/2512.23020"},"observation_digest":"sha256:6e6957b76efcc3524efaebc4d5d3ad6d9d2a74d0c24145ddde9b84c9a83622d5","observation_id":"f93a6b4e-bca8-4850-a1ac-808aa1fd3e24","resolution":{"observed_at":"2026-08-03T13:46:30.742617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.23020","last_updated":"2026-07-07T09:58:55Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:09:09.898549Z","submitted_at":"2025-12-28T17:44:20Z","title":"OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":76,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 0 inbound Pith citation observations for arXiv:2512.23020."}