{"as_of":"2026-08-07T15:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:edaf843eecb28e1ecee1ce8e052fca80ae70ded2f603e4f97b573585dc8f8601","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:04:26.911809Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.22817/citation-record","integrity":"/paper/2506.22817/integrity","json":"/paper/2506.22817/citation-record.json","paper":"/paper/2506.22817"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02548","last_updated":"2025-02-13T10:46:38Z","snapshot_observed_at":"2026-07-06T18:25:22.852874Z","submitted_at":"2024-06-04T17:59:31Z","title":"Open-YOLO 3D: Towards Fast and Accurate Open-Vocabulary 3D Instance Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02548","snapshot_observed_at":"2026-08-06T22:04:22.010410Z","title":"Open-yolo 3d: Towards fast and accurate open-vocabulary 3d instance segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:22.010410Z"},"links":{"cited_paper":"/paper/2406.02548","citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:6611620d1f52fc810b5f4f74cdbe3fc72b56a74dcb3d0a82213732922b8de9cd","observation_id":"d862c8fb-0622-4778-bee2-d0b2969728d3","resolution":{"observed_at":"2026-08-06T22:04:22.010410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:36.528220Z","title":"Matterport3d: Learning from rgb-d data in indoor environments","venue":null,"work_id":"eb0168f5-e451-4d2e-a908-1a1d6c4bfe7c","year":2017},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:22.071577Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:d7732e2d923546b0f955df661fa585d7094e10a17703b02ba8284b89eedae359","observation_id":"0a5c8f2f-b8cc-417e-b8bc-0075048536cb","resolution":{"observed_at":"2026-08-06T22:04:36.605437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:22.157362Z","title":"Clip2scene: Towards label-efficient 3d scene understanding by clip","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:22.157362Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:35d6e6c668392f4e31151f479f00933dd0a9d430c2b87fa7b2ea61ba6ae55409","observation_id":"817ea282-ef21-49ab-90b6-975c251dccff","resolution":{"observed_at":"2026-08-06T22:04:22.157362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:36.342925Z","title":"Yolo-world: Real-time open-vocabulary object detection","venue":null,"work_id":"4a0a985d-87d5-424d-81c1-11dd415b5e85","year":2024},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:22.249266Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:355b5b05156b2ba1c68bf754b8a37ad6b2690994daecda9e2590cfb4ec034808","observation_id":"221a3ce0-75cf-48e6-acc7-849d3156425a","resolution":{"observed_at":"2026-08-06T22:04:36.427717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:36.138560Z","title":"4d spatio-temporal convnets: Minkowski convolutional neu- ral networks","venue":null,"work_id":"3d371501-efd0-4572-b43d-be232b595d7c","year":2019},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:22.355844Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:c6a3597537daf0eb3a219ec0ed10f1af95bd01fa9c8c7d0d816675a41314df9a","observation_id":"aade28f8-34cc-4f69-8720-4b9de7222f8d","resolution":{"observed_at":"2026-08-06T22:04:36.252491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:35.969480Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":"065910a9-1289-4fc6-9233-4bcd98cead99","year":2017},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:22.437904Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:ad620ef2c69956907593335bfe9ff7f9009f5a87a73c80a5fcc6b3d9d5a68fc6","observation_id":"e325d129-4696-43da-a644-0f31ed7de852","resolution":{"observed_at":"2026-08-06T22:04:36.057704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:35.731784Z","title":"Pla: Language-driven open- vocabulary 3d scene understanding","venue":null,"work_id":"1c1d2e8f-197c-4d23-a332-6b4e5e8eccd5","year":2023},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:22.513194Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:7ff749d8797dd7fd60ba1c66a7c5118a3ee0c96c81b6e2003aa6a3268246b192","observation_id":"2c98312e-0c7c-4ea7-ab69-f040c085cf36","resolution":{"observed_at":"2026-08-06T22:04:35.820884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:35.471075Z","title":"A density-based algorithm for discovering clusters in large spatial databases with noise","venue":null,"work_id":"307ddae0-ab0f-4cc8-8401-2616af804ac5","year":1996},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:22.618688Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:5c7b87fe35629fb949a2a4d341f365290dd3fe2a2b98cc9ad9a561816defe481","observation_id":"d1c40434-2502-4382-a8c3-10198e2ea9ce","resolution":{"observed_at":"2026-08-06T22:04:35.597980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:35.232895Z","title":"Efficient graph-based image segmentation","venue":null,"work_id":"5f9e1e04-4fbf-45d4-9843-635f5c659a00","year":2004},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:22.699936Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:4d7641997ef13c79f45d4847f725a753b9cccce0d805ddcea56450368f183a8a","observation_id":"da4eb8b9-77c3-4f66-a972-72f2d89e7aac","resolution":{"observed_at":"2026-08-06T22:04:35.336113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:34.967711Z","title":"Scal- ing open-vocabulary image segmentation with image-level labels","venue":null,"work_id":"4a760af7-b9db-4a6b-90b3-34fa262d6c88","year":2022},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:22.777482Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:b1794c8e734841589e5f629c01db697713c1a534a96f82eff03315f516b1b539","observation_id":"1f8aed7b-1828-4be3-91f1-360252aefda2","resolution":{"observed_at":"2026-08-06T22:04:35.102671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:34.743984Z","title":"Sam-guided graph cut for 3d instance segmentation","venue":null,"work_id":"03b72b5e-46a9-4c2f-b886-b057ace0c273","year":2024},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:22.821605Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:72139b0f511db016e824ed83dc98fbb940ec68aab3d081d09e405aa5a8228dc7","observation_id":"85ed6f15-1795-40cc-a14d-7ed5193835f3","resolution":{"observed_at":"2026-08-06T22:04:34.842643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:34.505325Z","title":"spacy 2: Natural lan- guage understanding with bloom embeddings, convolutional neural networks and incremental parsing","venue":null,"work_id":"364fd299-57f1-463b-a461-b364f72f7350","year":2017},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:22.909272Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:2a7015898d88d7743d2e4ecbcaf26a6cfc41079f61a86cef247ce0d92e774f6e","observation_id":"c56b82a9-481e-4cc5-b0d2-88f168114bda","resolution":{"observed_at":"2026-08-06T22:04:34.620721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15200","last_updated":"2023-11-16T07:11:02Z","snapshot_observed_at":"2026-07-06T16:37:23.707569Z","submitted_at":"2023-10-23T08:13:33Z","title":"Open-Set Image Tagging with Multi-Grained Text Supervision","version":2},"cited_work":{"arxiv_id":"2310.15200","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.15200","snapshot_observed_at":"2026-08-06T22:04:27.106138Z","title":"Open-Set Image Tagging with Multi-Grained Text Supervision","venue":"cs.CV","work_id":"db2a07aa-9f9d-4d73-a4bd-d1315163dfc6","year":2023},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:22.991770Z"},"links":{"cited_paper":"/paper/2310.15200","citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:2ae852c2d6c2d522ceee734cffda01afd02df0bb8ab6113c67305739b93bb45b","observation_id":"e2ae8e89-bc58-444b-9583-e40b705df8d1","resolution":{"observed_at":"2026-08-06T22:04:27.162531Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:34.299886Z","title":"Odin: A single model for 2d and 3d segmentation","venue":null,"work_id":"9cd8f052-3bc2-48e7-a47c-2b5f3dadd707","year":2024},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:23.080658Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:0aa12fce060e267cc4686e8262b5f00a2cfc9e165888dde9ebe30e01aab65153","observation_id":"c22408fb-30cc-454f-ba23-2975b517077a","resolution":{"observed_at":"2026-08-06T22:04:34.404545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:34.021332Z","title":"Con- ceptfusion: Open-set multimodal 3d mapping","venue":null,"work_id":"bdaef3c9-ae87-452e-bc01-9dc005d87b7e","year":2023},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:23.155746Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:6f038f59fb577409e659869e088a7d8f74153b2e57ae1be9050e05a121dc6dd5","observation_id":"e9ab477e-a527-40b0-9369-b7991f928d63","resolution":{"observed_at":"2026-08-06T22:04:34.160072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:33.695057Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":"0527beac-fcfa-4465-9e11-26df2b350ad0","year":2021},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:23.203242Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:4c5bbefef49192d2cc76a4776706006d159982dacb196fff6ab7a20cbb12c039","observation_id":"02e28432-4ef9-4e2a-9420-90ca782c20ab","resolution":{"observed_at":"2026-08-06T22:04:33.833358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:33.420547Z","title":"Pointgroup: Dual-set point group- ing for 3d instance segmentation","venue":null,"work_id":"0a852268-5fbf-484f-8ac7-11853442585a","year":2020},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:23.293731Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:4a6ef46ad4799714a290932d9c7651a501e0a3abfa5977dde419610739389321","observation_id":"0aedb603-85e6-4dfb-8e34-285348d27db4","resolution":{"observed_at":"2026-08-06T22:04:33.536514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:33.098393Z","title":"Open-vocabulary 3d semantic segmentation with foundation models","venue":null,"work_id":"a27687ea-df04-49e0-a213-9b8e6fa4c2fb","year":2024},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:23.352475Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:261c761f04523f0d44d744fdc2de3824a7ff784d5f3a158b553700fdbc56ea8e","observation_id":"c1f5d4af-1562-41c8-9058-30f798b0e6a8","resolution":{"observed_at":"2026-08-06T22:04:33.256176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:32.845806Z","title":"Segment any- thing","venue":null,"work_id":"a28514ea-0ede-45a9-85dd-a5e3d95a84cc","year":2023},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:23.440915Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:8a0d02874bcb3143d2f7f771607050ad16bf5f5c8a631edbe116048eaed15b17","observation_id":"481c95b7-e3f8-4e1a-8427-60d192cda968","resolution":{"observed_at":"2026-08-06T22:04:32.977129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02157","last_updated":"2024-04-02T17:59:10Z","snapshot_observed_at":"2026-07-06T17:54:43.685212Z","submitted_at":"2024-04-02T17:59:10Z","title":"Segment Any 3D Object with Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02157","snapshot_observed_at":"2026-08-06T22:04:23.521003Z","title":"Seg- ment any 3d object with language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:23.521003Z"},"links":{"cited_paper":"/paper/2404.02157","citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:82fe4438be290676a95277c1ea5f3111ee093142d748b5c83e31bd1b59bf732d","observation_id":"d55d3f15-4868-472e-90ca-007d5cf55a39","resolution":{"observed_at":"2026-08-06T22:04:23.521003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:32.591949Z","title":"Language-driven semantic seg- mentation","venue":null,"work_id":"b33d394d-8ec6-4628-834d-d5df3e4d8dfd","year":2022},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:23.650481Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:60ee2ff612e353fbab1dd99604e4c2c1377778944ebe315965cd4da5675ffca9","observation_id":"87f496db-a38c-4b33-be66-2d9be5002250","resolution":{"observed_at":"2026-08-06T22:04:32.711837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:32.359703Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":"f5f4d6cb-a70b-435a-9fac-fc0c0ce31624","year":2022},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:23.704502Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:30f0d37a273d312d0473714b4715de8cf549c73205de53cb0ed412d7fe28d443","observation_id":"c277b8fd-9aff-4d86-a887-ac667d61faeb","resolution":{"observed_at":"2026-08-06T22:04:32.445243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:32.146840Z","title":"Grounded language-image pre-training","venue":null,"work_id":"d8082b5a-93f7-4a24-ac4a-feb5a92e577e","year":2022},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:23.809703Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:2fbcd4c044c4154fa6afe961a843f3103a08a70a2e4a45c4a87f8fd2fe43e6fe","observation_id":"ed9a6c5e-9f19-464d-81d0-5ecd83f37dae","resolution":{"observed_at":"2026-08-06T22:04:32.237398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:31.926751Z","title":"Decap: Decoding clip latents for zero-shot captioning via text-only 2 training","venue":null,"work_id":"622a57dd-97ba-45bf-b739-fb8f4c6b96b7","year":2023},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:23.876577Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:4a9261022096d77e109960e3ad4999b5e8bb3ec307ea5fa99b2fed08134f8b61","observation_id":"2d752310-2e3d-42d9-9dcc-5ae62c6f966b","resolution":{"observed_at":"2026-08-06T22:04:32.035731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:23.977911Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:23.977911Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:35bbe24e82dc5c31175d668a2528b5f9bcb3b4333f949e4eaed1526b6baede4a","observation_id":"ef56cedc-8d59-4cab-be92-20c9776cffaf","resolution":{"observed_at":"2026-08-06T22:04:23.977911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-06T22:04:24.039336Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:24.039336Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:684beabe0fc51b6881e7933be73792d44331c53083ce8e6df3275d78578e942e","observation_id":"49a463a6-d0dd-44dc-a926-ee60422fd869","resolution":{"observed_at":"2026-08-06T22:04:24.039336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:31.635994Z","title":"Ovir-3d: Open-vocabulary 3d in- stance retrieval without training on 3d data","venue":null,"work_id":"54660957-8ad4-42b8-b60c-667b031ecbcf","year":2023},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:24.101366Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:2113dcf5f07962eced41effb1947a7e481fe1e97ea42ac8839315c952fdb14ed","observation_id":"2bef844e-217b-4ee7-89b5-d1e83e7972a0","resolution":{"observed_at":"2026-08-06T22:04:31.758417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:24.177736Z","title":"An end-to- end transformer model for 3d object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:24.177736Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:206f8c48fb7b7e93f07ad4f2eb1c9c58c5319114fc06f8f185930a78256a34c0","observation_id":"78e18653-9ae1-4f41-ba5d-378c4fac1c9e","resolution":{"observed_at":"2026-08-06T22:04:24.177736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:31.436698Z","title":"Isbnet: a 3d point cloud instance segmentation network with instance- aware sampling and box-aware dynamic convolution","venue":null,"work_id":"b7d641c3-124f-4109-b455-b646fb852cce","year":2023},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:24.257808Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:41c3dca384680c24dba07fe85c20293055946d2636b8bbabc7da65948d40a85b","observation_id":"1ded09a3-37f7-4e31-a942-01732b4775f8","resolution":{"observed_at":"2026-08-06T22:04:31.504554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:31.151421Z","title":"Open3dis: Open-vocabulary 3d instance segmentation with 2d mask guidance","venue":null,"work_id":"f2e2133c-b8d7-4e0e-b7d5-8d9df0a98c84","year":2024},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:24.338008Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:f17aac35dc9ccfa38196ffdbca4c0b1420ed6b67923b6fd377570a84a7b02238","observation_id":"ff8a22de-058e-4002-811f-b1881c0ff054","resolution":{"observed_at":"2026-08-06T22:04:31.288532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:30.895743Z","title":"V oxel cloud connectivity segmentation- supervoxels for point clouds","venue":null,"work_id":"30dd266d-8b9d-48f7-8d74-70769aacc12b","year":2027},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:24.406111Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:ebc8fd539db089885e89905d5c390c6fec872195a4472dacbd70f6d56addcf89","observation_id":"6ea5db78-d815-4c22-a769-3b417885b848","resolution":{"observed_at":"2026-08-06T22:04:31.020530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:30.630561Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":"ab8ea652-4388-43c5-8114-81338e871d5c","year":2023},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:24.455441Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:5c247e8a76b7127a76eaac137c4addd9702e77090c9375b03cb030d202a6b128","observation_id":"6d8875fd-fabc-4f8b-b423-6a146be19250","resolution":{"observed_at":"2026-08-06T22:04:30.783522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-06T22:04:24.595455Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:24.595455Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:d69938951222ccb7af00484a99d0a649f84ef8ed17fa4dfb153c11e33924f91a","observation_id":"41261cd9-0f92-471a-be01-3c8e93769ee4","resolution":{"observed_at":"2026-08-06T22:04:24.595455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:30.394903Z","title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space","venue":null,"work_id":"07edf97f-a154-433f-893d-7415d47c7517","year":2017},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:24.712330Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:b5ae46c29fc41696851dfdee7f91d922ff53cad055bdeeaf7d4303fbe822e94b","observation_id":"f8a9ab7c-b2b5-4246-b961-4ba0d4178294","resolution":{"observed_at":"2026-08-06T22:04:30.530755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:30.131345Z","title":"Pointnext: Revisiting pointnet++ with improved training and scaling strategies","venue":null,"work_id":"8aeddf67-6838-4934-ab88-87f72ac13108","year":2022},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:24.813661Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:4ab160163ff42caa8a29dd1e757395972a03dcd4b6fda6223477892e9745fb87","observation_id":"1245972d-d8c0-4a64-99c6-c2ec725bae19","resolution":{"observed_at":"2026-08-06T22:04:30.233921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:29.918665Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"ce22f848-0aef-4750-8f6a-c9b1590dcc92","year":2021},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:24.906952Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:8114a90a62a47545dce5c561a0bce61026950d5c054cc0426b0a331ef68bef13","observation_id":"e783c82f-3083-4223-ae58-2b2dabd020fd","resolution":{"observed_at":"2026-08-06T22:04:30.018565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:29.699584Z","title":"Language- grounded indoor 3d semantic segmentation in the wild","venue":null,"work_id":"129c62e3-7347-4910-9658-935b8a0cda2e","year":null},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:24.978354Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:c852d6337f0e01e9b11701aac4cd5705eaeaa5d63fc08baf610e7760267a7a27","observation_id":"ce3af4e4-8fb1-45ef-843c-4c957316bc50","resolution":{"observed_at":"2026-08-06T22:04:29.777998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:29.490777Z","title":"Dense multimodal alignment for open-vocabulary 3d scene understanding","venue":null,"work_id":"b2947063-5bcb-4d3b-8321-9a738c3bcba7","year":2024},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:25.074672Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:4df30b136234d1a359c0899cdaf279e8d2e67149b55d2df307056849ca0abff2","observation_id":"87199b5b-123c-4058-af14-2459ac33dc25","resolution":{"observed_at":"2026-08-06T22:04:29.587167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:29.335619Z","title":"Mask3d: Mask trans- former for 3d semantic instance segmentation","venue":null,"work_id":"e796ab19-422e-464b-9a4a-a794661eff2b","year":2023},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:25.178981Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:1b5ab62dab61f9cd41503cc55a36783383bfdf758d715f67cfc8702e4804dd39","observation_id":"caba26fd-c95e-4145-a951-3415bfd46ee5","resolution":{"observed_at":"2026-08-06T22:04:29.417674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:25.277779Z","title":"Pointr- cnn: 3d object proposal generation and detection from point cloud","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:25.277779Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:e2ef131e14a8bca9cd71412224fc04cffbce0fdea8c5369a225676e4d6c77bc7","observation_id":"144baabf-9704-493e-af1d-e4065f70590c","resolution":{"observed_at":"2026-08-06T22:04:25.277779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05797","last_updated":"2019-06-13T16:29:58Z","snapshot_observed_at":"2026-08-01T13:51:16.469557Z","submitted_at":"2019-06-13T16:29:58Z","title":"The Replica Dataset: A Digital Replica of Indoor Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05797","snapshot_observed_at":"2026-08-06T22:04:25.352234Z","title":"The replica dataset: A digital replica of indoor spaces","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:25.352234Z"},"links":{"cited_paper":"/paper/1906.05797","citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:96f82782b0b797807325b6dbfb08e6f836e561d50d7aa88f43efbc443d339b02","observation_id":"e1fc3a7d-c0f7-4299-946c-047ecd3e4457","resolution":{"observed_at":"2026-08-06T22:04:25.352234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:29.202411Z","title":"Open- mask3d: open-vocabulary 3d instance segmentation","venue":null,"work_id":"c15cbad8-8c05-45fb-b027-7dfe23cc9904","year":null},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:25.418913Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:b4dbdcdb85152bc66255ba782cd81ebfee395de35bed4d0fcb1400cdd6edbdd2","observation_id":"29eb27ca-f877-4a1e-afe7-a95ac6682dbb","resolution":{"observed_at":"2026-08-06T22:04:29.244663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:29.053528Z","title":"Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","venue":null,"work_id":"f924b712-9cfe-4619-b721-5fc5d9e94e43","year":2022},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:25.484739Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:baf5e293d28a9038f434cf8d0fc5dc1cdd2c45fbbe80480fa232c571a0c98994","observation_id":"06d30a65-8d4b-412b-b94d-c319ffb436ab","resolution":{"observed_at":"2026-08-06T22:04:29.152314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:28.994884Z","title":"Open vocabulary 3d scene under- standing via geometry guided self-distillation","venue":null,"work_id":"c8f8aade-a973-455e-9719-4fef2ed570f8","year":2024},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:25.564953Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:1d0626c999baeb1d5dcd97c60c07dacf78a0207f6d9ce0a76643431f88ef23f4","observation_id":"6e55810b-e7e8-4d45-a634-fb19c99fbd84","resolution":{"observed_at":"2026-08-06T22:04:29.046440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:28.891391Z","title":"Detr3d: 3d object detection from multi-view images via 3d-to-2d queries","venue":null,"work_id":"f084ed6b-b844-4e4b-a9e3-ceb0c5b244eb","year":null},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:25.629129Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:5fd95586d30e150fd24988566ae832eff2f1c17e2ef43819a43f1540f0795c21","observation_id":"c2c0fcc5-b4fe-4ca7-943f-3b736b1ba0d6","resolution":{"observed_at":"2026-08-06T22:04:28.937754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:28.779877Z","title":"Uni3detr: Unified 3d detection trans- former","venue":null,"work_id":"4942307d-8aba-4859-8dfe-aaef304fb2a0","year":2023},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:25.674003Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:ff15136874af977c50c1635eed95382999e45c079f1f77cbb11ba71ac5c116ad","observation_id":"f98a4414-c302-4e2e-bc9c-b6af28403af1","resolution":{"observed_at":"2026-08-06T22:04:28.837411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:28.677954Z","title":"Point transformer v3: Simpler faster stronger","venue":null,"work_id":"7eac55ac-cb75-45ae-a283-de1197589ca9","year":2024},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:25.735877Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:b5ca1b243abb68b0939624c6d1be856621063f0c857f1a44209449b79228a3d5","observation_id":"d53afc04-3ee3-4b33-aaa1-191d221b7f27","resolution":{"observed_at":"2026-08-06T22:04:28.715963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:28.579093Z","title":"Open-vocabulary panop- 3 tic segmentation with text-to-image diffusion models","venue":null,"work_id":"be557c89-6fe7-4289-a52d-39ef68bea132","year":2023},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:25.810601Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:7a86eb6dc1b281df5d757cfabcc7f4bcac10321779979901ba0ec21d44ad1a7d","observation_id":"b13d381d-c0aa-4ba0-933c-e9943c23fb9b","resolution":{"observed_at":"2026-08-06T22:04:28.633199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:28.515113Z","title":"Paconv: Position adaptive convolution with dy- namic kernel assembling on point clouds","venue":null,"work_id":"41105b59-aa61-48a4-bf58-8d68043dacaf","year":2021},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:25.853406Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:8a15e84609249f38f62c0b73c0d1923cd1bfba298b68abb472506833a332eaac","observation_id":"fc4587d7-fd21-485f-be34-8dd8e54e0d60","resolution":{"observed_at":"2026-08-06T22:04:28.543457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17707","last_updated":"2025-02-04T11:40:44Z","snapshot_observed_at":"2026-07-06T16:54:26.205948Z","submitted_at":"2023-11-29T15:11:03Z","title":"SAMPro3D: Locating SAM Prompts in 3D for Zero-Shot Instance Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17707","snapshot_observed_at":"2026-08-06T22:04:25.946778Z","title":"Sampro3d: Locating sam prompts in 3d for zero-shot scene segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:25.946778Z"},"links":{"cited_paper":"/paper/2311.17707","citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:0795db0ca682cec4d357d9e43536523b959eed4cfceec916243ba1d88aeff4a2","observation_id":"a1465d24-4171-442b-b92f-ff475a070587","resolution":{"observed_at":"2026-08-06T22:04:25.946778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:28.404130Z","title":"A unified framework for 3d scene understanding","venue":null,"work_id":"485cc962-57e8-4a40-8573-c6fe856fcd94","year":2024},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:26.007884Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:4af24956afda2c4ca2a5ecec29650957e851a4752e68ccc8183065546927bf95","observation_id":"25cb3969-22a2-40b6-ad59-feb63a1b2f00","resolution":{"observed_at":"2026-08-06T22:04:28.453467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:28.320583Z","title":"Regionplc: Regional point-language contrastive learning for open-world 3d scene understanding","venue":null,"work_id":"0d520963-18d1-4bb9-b2ee-a3d5dfb1751f","year":2024},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:26.049587Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:240b0a2c52e4b58d007ac559debc41aeda5b7ab19708f550b11f52d4e0cfb9d7","observation_id":"1bad85a9-7d29-4045-b462-e393dfbb24f5","resolution":{"observed_at":"2026-08-06T22:04:28.365669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:28.214735Z","title":"Sa3dip: Segment any 3d instance with potential 3d priors","venue":null,"work_id":"9e277611-4eff-4c5b-8bfb-8b3122f10d95","year":2024},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:26.130338Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:36a71003c22b0301444784385c7ee46b5f5f34ac81ee6f51b39c21e1ae37ea7c","observation_id":"86e4464a-03c7-4444-9c8e-6d82710e2d65","resolution":{"observed_at":"2026-08-06T22:04:28.252504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03908","last_updated":"2023-06-06T17:59:51Z","snapshot_observed_at":"2026-07-06T15:39:22.864048Z","submitted_at":"2023-06-06T17:59:51Z","title":"SAM3D: Segment Anything in 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03908","snapshot_observed_at":"2026-08-06T22:04:26.211071Z","title":"Sam3d: Segment anything in 3d scenes.arXiv preprint arXiv:2306.03908, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:26.211071Z"},"links":{"cited_paper":"/paper/2306.03908","citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:1bdc2c4c75ac5dfc83fd3c891d0397132b57dbda52f49e37abd3dedbef85bba1","observation_id":"57d72f2d-c14b-4814-b926-729e614e05bd","resolution":{"observed_at":"2026-08-06T22:04:26.211071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:28.108222Z","title":"Point deformable network with enhanced nor- mal embedding for point cloud analysis","venue":null,"work_id":"a2632c4c-f36d-42ae-b5b3-d6d73d4f25d8","year":2024},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:26.321851Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:adede1e23b9e63373a2df07da9b291712c63e9b0d05326957e96cf37623b6db4","observation_id":"4c503099-ae0c-4611-8aa9-392a2abfb99c","resolution":{"observed_at":"2026-08-06T22:04:28.148885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:28.017868Z","title":"Sai3d: Segment any instance in 3d scenes","venue":null,"work_id":"68d2ee9b-21ff-4c50-9e6d-ef6a23a63a1d","year":2024},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:26.399770Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:51da907245d0fda67b41ad60611be5ae220d92973793e92c837650caf8801639","observation_id":"a4edc5ae-8f26-490b-8637-de3c652bf272","resolution":{"observed_at":"2026-08-06T22:04:28.062390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:27.939954Z","title":"Convolutions die hard: Open-vocabulary seg- mentation with single frozen convolutional clip","venue":null,"work_id":"1d56e779-bbc5-42e9-85e5-2b6f92c43d1f","year":2023},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:26.485535Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:14ea5a3337b0a45d02cca542fc51c7ea14fd6e70a0b748e3f24cabbb7fae1573","observation_id":"87f8f197-2039-4b13-a046-9793e04d82f7","resolution":{"observed_at":"2026-08-06T22:04:27.968280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:27.835060Z","title":"Recognize anything: A strong image tagging model","venue":null,"work_id":"fe30d572-6595-4665-a6d3-df26dcc85c25","year":2024},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:26.585203Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:8cb10b53f6d1bb1de7f930628a204403fd650463e233176d448a443386a46bb8","observation_id":"d9e1f414-50e4-40cc-afdc-03647a7ff35b","resolution":{"observed_at":"2026-08-06T22:04:27.875800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:27.747938Z","title":"Point transformer","venue":null,"work_id":"45aafb98-dfc4-4370-aa75-c0528ce0ee45","year":2021},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:26.664878Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:09fdec12bed7e273b35386af9a107b5c66d916c85a88f40e2d9804299a6cac63","observation_id":"4399e95b-2d94-4dc2-a7c2-d401a625b62f","resolution":{"observed_at":"2026-08-06T22:04:27.789413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:27.618489Z","title":"Se- ssd: Self-ensembling single-stage object detector from point cloud","venue":null,"work_id":"6375ad1f-e7df-4861-af8d-8d65f27cf073","year":null},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:26.765134Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:3d7d2f625ec427fdfaca3d3fa0f0fbda1224ab2e9ee6953df30467b409e1966b","observation_id":"87774ca9-b572-4089-94c6-198c6dd3e27e","resolution":{"observed_at":"2026-08-06T22:04:27.655081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:27.448087Z","title":"Detecting twenty-thousand classes using image-level supervision","venue":null,"work_id":"ccae7034-4807-449c-9f52-355923778d89","year":2022},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:26.846855Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:b33525759a4205292ecf1f8bfae925ed648a62bc84b912218e0993ca36156ce1","observation_id":"9dd8fe42-6988-4e8c-aafe-49a356da40d7","resolution":{"observed_at":"2026-08-06T22:04:27.511718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:27.239723Z","title":"Open-vocabulary 3d semantic segmentation with text-to-image diffusion models","venue":null,"work_id":"1c32eb45-1e14-4aa4-b90c-38f612f8c6ad","year":2024},"citing_paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:26.911809Z"},"links":{"citing_paper":"/paper/2506.22817"},"observation_digest":"sha256:e5046ba5d77dcbe415a6273a15c5a1af19d655111180b5fba1b7ea8b21a41ac0","observation_id":"0eefbddc-203e-45da-a043-65961e46fda9","resolution":{"observed_at":"2026-08-06T22:04:27.346606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.22817","last_updated":"2025-06-28T08:40:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:54:57.563910Z","submitted_at":"2025-06-28T08:40:42Z","title":"Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":50},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2506.22817."}