{"as_of":"2026-08-13T05:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8e69bfa447e20038a92074a292f4c326b495b3a6940d8121316621e847d85500","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:46:10.072459Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.13243/citation-record","integrity":"/paper/2411.13243/integrity","json":"/paper/2411.13243/citation-record.json","paper":"/paper/2411.13243"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:09.835898Z","title":"3d semantic parsing of large-scale indoor spaces","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.835898Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:05e300bd17c07aaf37dfadd7d2a2765361827742f35642c5d79d733824b77f74","observation_id":"cf1a2954-5bf4-4875-b748-477ce9e0d64c","resolution":{"observed_at":"2026-08-12T16:46:09.835898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:09.841512Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.841512Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:9ca5d710bc3fca2b626818036ed4e1904f6fde3dd74de44fc555d2e2f18069e7","observation_id":"78a22aa5-8226-45e1-8b61-3f5f734538fb","resolution":{"observed_at":"2026-08-12T16:46:09.841512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.781373Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":"4e37d31c-6d9a-44f0-996e-ea61da34204d","year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.846666Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:17d9261f32de0983645b07d7cbd97dc77083e002f143de330352656f1ea1d7c7","observation_id":"7f36bd1a-307a-4595-8e54-35d1243464f8","resolution":{"observed_at":"2026-08-12T16:46:10.786369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.764533Z","title":"Per-pixel classification is not all you need for semantic segmentation","venue":null,"work_id":"7ecf42d6-0864-4c2f-91a1-fa555f76c82f","year":2021},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.851979Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:f2f4eabdd990d5503c064fdae434184033de9657acd2780b8d814370c1684ecf","observation_id":"558d4a84-abc6-47f0-b362-5249f61db796","resolution":{"observed_at":"2026-08-12T16:46:10.769872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.749266Z","title":"Transductive zero-shot learning for 3d point cloud classification","venue":null,"work_id":"e76bd8ce-89d5-467d-9c7c-473c5bb57dd0","year":2020},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.857085Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:3f1d7d18c45f92637e5f5d62a6af7c5b8ad9743139b026de74f0b9555c3053d6","observation_id":"857ed3f8-de2b-469a-b7f1-25dbbf8bdc2b","resolution":{"observed_at":"2026-08-12T16:46:10.754268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11797","last_updated":"2024-03-31T11:53:55Z","snapshot_observed_at":"2026-08-10T15:40:12.549701Z","submitted_at":"2023-03-21T12:28:21Z","title":"CAT-Seg: Cost Aggregation for Open-Vocabulary Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11797","snapshot_observed_at":"2026-08-12T16:46:09.861897Z","title":"Cat-seg: Cost aggregation for open-vocabulary semantic segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.861897Z"},"links":{"cited_paper":"/paper/2303.11797","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:e7002b0ab7185021ad481b86fcc920b678709c21e3eca3ad7b0a94f7cff1273f","observation_id":"11d8c0be-a93f-452b-acb4-bfe4445bf919","resolution":{"observed_at":"2026-08-12T16:46:09.861897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.733882Z","title":"4d spatio-temporal convnets: Minkowski convolutional neural networks","venue":null,"work_id":"1fcedfa4-60e6-4fc2-85b9-c2f004a2f69a","year":2019},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.867561Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:e316833c80b38294a0b5a1eb5dac6b1e95979965ad130d8caae5738ad5b0245d","observation_id":"721146ed-8144-491d-9086-aaa2a1988be3","resolution":{"observed_at":"2026-08-12T16:46:10.738908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:09.871855Z","title":"Spconv: Spatially sparse convolution library","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.871855Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:a0d0d8f1df93352d90c317e524387a9036117ae621d0872672c27bae2c39ec1d","observation_id":"83eb9f6b-6e09-4c81-a1ba-d9d7c3f3e2b1","resolution":{"observed_at":"2026-08-12T16:46:09.871855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:09.876484Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.876484Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:c326daf2532df22f1e3ffa1209ff8a4b8a98cdaa0346976b8390861b111ca6cf","observation_id":"b822299a-bca6-46ac-ba91-9d1bbdf56dd3","resolution":{"observed_at":"2026-08-12T16:46:09.876484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.699275Z","title":"Decoupling zero-shot semantic segmen- tation","venue":null,"work_id":"1f45867a-23db-413a-bfa0-cc7437701a46","year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.881197Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:1e419d288a9388590f3ef665e95818b0f46ca0bec5494be2bffdb92f4c5e0767","observation_id":"efd47bee-b905-467c-9dc8-1e812a919cf2","resolution":{"observed_at":"2026-08-12T16:46:10.704441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:09.885601Z","title":"Pla: Language-driven open-vocabulary 3d scene understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.885601Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:e11d2b67e54c228909578007ae20e0a34471c4ee1288e936c55ea11f8f169040","observation_id":"dcf081a5-4de0-44a2-b913-ffb064558750","resolution":{"observed_at":"2026-08-12T16:46:09.885601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.673541Z","title":"Open-vocabulary universal image segmentation with maskclip","venue":null,"work_id":"463cfe97-ae13-4c37-b907-2e7970db5988","year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.890230Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:4e2f847f13926dc5c1496871cb33c482fc8ef8bf355c84796c9c7882255a77b2","observation_id":"ea3da3bf-6a19-47d2-b36d-189d3cc877cb","resolution":{"observed_at":"2026-08-12T16:46:10.678562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.657419Z","title":"Scaling open-vocabulary image segmen- tation with image-level labels","venue":null,"work_id":"450b2006-a2c8-4c96-af4d-685f8b6b2ab1","year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.894688Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:e6e3ecd6073aab126a6b79a1288b95a27a48ec0438fa5866e865a2c3bc378024","observation_id":"d060d7ef-3829-4316-9136-70ade5a9db14","resolution":{"observed_at":"2026-08-12T16:46:10.662409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-10T23:05:27.308529Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-12T16:46:09.898818Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.898818Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:dd6be2597c7495eb7e95dd18321534cff4992fc4a669d0df925e95020059ddc8","observation_id":"e5f36373-22e4-4d0a-8927-2f1f0ca5b3ce","resolution":{"observed_at":"2026-08-12T16:46:09.898818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.11514","last_updated":"2022-12-06T11:09:39Z","snapshot_observed_at":"2026-08-10T18:29:51.388117Z","submitted_at":"2022-07-23T13:10:25Z","title":"Semantic Abstraction: Open-World 3D Scene Understanding from 2D Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.11514","snapshot_observed_at":"2026-08-12T16:46:09.903856Z","title":"Semantic abstraction: Open-world 3d scene understanding from 2d vision-language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.903856Z"},"links":{"cited_paper":"/paper/2207.11514","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:c7e246ecf8e9bbd8dd3094d02eb03655fd627e9f45b9012e78a2abe096b92aa0","observation_id":"9a355519-75d1-4bb9-9e98-f979e2d83829","resolution":{"observed_at":"2026-08-12T16:46:09.903856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11395","last_updated":"2024-04-21T03:26:27Z","snapshot_observed_at":"2026-08-13T04:38:26.755850Z","submitted_at":"2024-01-21T04:13:58Z","title":"UniM-OV3D: Uni-Modality Open-Vocabulary 3D Scene Understanding with Fine-Grained Feature Representation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11395","snapshot_observed_at":"2026-08-12T16:46:09.908857Z","title":"Unim-ov3d: Uni-modality open- vocabulary 3d scene understanding with fine-grained feature representation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.908857Z"},"links":{"cited_paper":"/paper/2401.11395","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:a33352e9f3aaee5fb70c954d1d8b5bb2833baf0821471e4f25f7606f98172437","observation_id":"1ad8db9a-f275-43a1-af8e-67e9ed00dcbc","resolution":{"observed_at":"2026-08-12T16:46:09.908857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-12T16:46:09.913908Z","title":"Prompt-to-prompt image editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.913908Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:a7ae30a1a290300c1bcabd2cf5d76caf612e9e460b72d6a11243e74b0985aada","observation_id":"0f93fb09-3cd1-4cad-958b-cfe34be54ea7","resolution":{"observed_at":"2026-08-12T16:46:09.913908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.642426Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"7febca92-ac4b-411c-a346-86654c25bd82","year":2020},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.919063Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:e884618792ab07c5bf1e54e0919b6041c89256e2affcd070011d9acdca6d3cf2","observation_id":"80fb5555-0805-41b3-b501-bfb86c64254c","resolution":{"observed_at":"2026-08-12T16:46:10.647307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:09.923653Z","title":"Clip2point: Transfer clip to point cloud classification with image-depth pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.923653Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:5b66447d725b0c44f3424f869e73ba1787516c5965ec78b505222f455af79dc5","observation_id":"dab2d84f-8365-4fc7-a82a-dbc632566b50","resolution":{"observed_at":"2026-08-12T16:46:09.923653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.618033Z","title":"Open-vocabulary 3d semantic segmentation with foundation models","venue":null,"work_id":"98e2735b-f8c0-4d96-b633-67a15acafc89","year":2024},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.928234Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:e3ac2cf28beae82a1096d44bb0d28ed7846b4afbf6820cc4fa1ee522adc27e93","observation_id":"62cfd89d-462a-499a-b6f1-6203bb873b54","resolution":{"observed_at":"2026-08-12T16:46:10.622689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09316","last_updated":"2024-09-30T03:17:39Z","snapshot_observed_at":"2026-08-10T21:35:35.307242Z","submitted_at":"2023-06-15T17:51:28Z","title":"Diffusion Models for Open-Vocabulary Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09316","snapshot_observed_at":"2026-08-12T16:46:09.932975Z","title":"Diffusion models for zero-shot open-vocabulary segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.932975Z"},"links":{"cited_paper":"/paper/2306.09316","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:255829c7398d8d5ed3d975cf11bdc2b57095439a95049a774fd7f29976d8a096","observation_id":"609eb4ee-0363-47ab-915a-ce8ad7489197","resolution":{"observed_at":"2026-08-12T16:46:09.932975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:09.937672Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.937672Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:2e58a5bbd0c5c707d1e5760334e1e23c5d61432b87c3d3a55a674f5122134804","observation_id":"ce77b63d-a1f3-4478-8f2a-52061a56d790","resolution":{"observed_at":"2026-08-12T16:46:09.937672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03546","last_updated":"2022-04-03T03:33:43Z","snapshot_observed_at":"2026-08-01T06:14:31.660540Z","submitted_at":"2022-01-10T18:59:10Z","title":"Language-driven Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03546","snapshot_observed_at":"2026-08-12T16:46:09.941912Z","title":"Language- driven semantic segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.941912Z"},"links":{"cited_paper":"/paper/2201.03546","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:6262bba1c7f82967bcd44cdafe16040115dae800adaa57cfdfe222b840628ede","observation_id":"39e53374-2591-465a-91eb-1659c74ed2d4","resolution":{"observed_at":"2026-08-12T16:46:09.941912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07547","last_updated":"2024-09-03T03:20:54Z","snapshot_observed_at":"2026-08-10T01:18:55.752093Z","submitted_at":"2023-04-15T12:52:23Z","title":"TagCLIP: Improving Discrimination Ability of Open-Vocabulary Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07547","snapshot_observed_at":"2026-08-12T16:46:09.946613Z","title":"Tagclip: Improving discrimination ability of open-vocabulary semantic segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.946613Z"},"links":{"cited_paper":"/paper/2304.07547","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:b3724c2ff4e7de95bee75edc1124c9975bf18153f24eee3b3ddc0d369d30decd","observation_id":"52d6224d-8473-404d-976d-a8d9d99b8466","resolution":{"observed_at":"2026-08-12T16:46:09.946613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.593182Z","title":"Guiding text-to-image diffusion model towards grounded generation","venue":null,"work_id":"f0e9f0fa-93ad-42b9-8ff9-742f6ae6deb7","year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.951597Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:7df7a3476d46a2085d925f34703dc5e9a8c9cd207a72d3f776143fdc9c5d2b4a","observation_id":"fc44eab2-f161-4e25-aa9f-037048dc1e9d","resolution":{"observed_at":"2026-08-12T16:46:10.598419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.578151Z","title":"Magic3d: High-resolution text-to-3d content creation","venue":null,"work_id":"152905c3-aa4e-4bc5-8baa-4bf5bdba0946","year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.955911Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:f150243e727311f4d9e25eb8a639f7ce2f1d1a5ea25df720c1e2ac8430cf5be1","observation_id":"64846e98-c1f8-4e76-b350-034dbd85ba83","resolution":{"observed_at":"2026-08-12T16:46:10.582927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14093","last_updated":"2024-01-09T17:09:47Z","snapshot_observed_at":"2026-08-12T10:03:41.925436Z","submitted_at":"2023-05-23T14:16:49Z","title":"Weakly Supervised 3D Open-vocabulary Segmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14093","snapshot_observed_at":"2026-08-12T16:46:09.960220Z","title":"3d open-vocabulary segmentation with foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.960220Z"},"links":{"cited_paper":"/paper/2305.14093","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:585f00b77560543de027a4024e1066406c5aec65df2d4cde3672015c789c476c","observation_id":"19c529cf-e808-47ab-b667-9314e3f8ea13","resolution":{"observed_at":"2026-08-12T16:46:09.960220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.563152Z","title":"Segment any point cloud sequences by distilling vision foundation models","venue":null,"work_id":"40e7565f-cc1d-42de-8d2a-9185495425b9","year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.964909Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:c8092632a199903e0e8effa7ad4da614648232d52b2e5728d03a34c6a492d184","observation_id":"7077cfea-7048-4b40-b00e-047fd27ca418","resolution":{"observed_at":"2026-08-12T16:46:10.568087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T16:46:09.969515Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.969515Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:26bedeca667dd173277db9984df9f3289faae2cc8b64e919deb3d11ff391f1c2","observation_id":"27448eb0-aeb7-43a9-93c4-9fbc36512e56","resolution":{"observed_at":"2026-08-12T16:46:09.969515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15138","last_updated":"2022-10-27T02:57:26Z","snapshot_observed_at":"2026-08-05T17:32:06.749601Z","submitted_at":"2022-10-27T02:57:26Z","title":"Open-vocabulary Semantic Segmentation with Frozen Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2210.15138","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.15138","snapshot_observed_at":"2026-08-12T16:46:10.177483Z","title":"Open-vocabulary Semantic Segmentation with Frozen Vision-Language Models","venue":"cs.CV","work_id":"b538b066-9cc3-4ba0-9ae0-62b72e97e0a2","year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.974385Z"},"links":{"cited_paper":"/paper/2210.15138","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:c9337797f25daf0815b690559a1e4f975a8b07cb04755bc167727cc53c555afe","observation_id":"395aba57-d766-42d7-873b-cb4d2912e21b","resolution":{"observed_at":"2026-08-12T16:46:10.182714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.547981Z","title":"Generative zero-shot learning for semantic segmentation of 3d point clouds","venue":null,"work_id":"0bdba249-c7b0-472f-a748-068b4095b675","year":2021},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.978968Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:9af2add83719d8d31d4630996aee45422b01479dda4ce6ea848f96a8d4712758","observation_id":"eac43e42-c907-41be-928d-0f8f12efa93e","resolution":{"observed_at":"2026-08-12T16:46:10.553002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:09.983560Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.983560Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:1748522c490380d8cffe5c1135078ec33545ae449aa6e7fd7ea8c3fe0c4b279d","observation_id":"5dd0dbd7-89bc-4da2-bd26-15f2e8b8e4bb","resolution":{"observed_at":"2026-08-12T16:46:09.983560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-12T16:46:09.987758Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.987758Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:a7a63cba34995191d398702386b0126396446d38a3dd47ab353e00e0e6b47187","observation_id":"7ba131b5-fb58-4b05-8bdc-28e47a8432b9","resolution":{"observed_at":"2026-08-12T16:46:09.987758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:09.993708Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.993708Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:56e1546a502c9e67d431d55b288ad35f5556a2d3bec3ce2813875e45d717f13e","observation_id":"0b2204d1-82d8-403f-9f6d-1d93b0da5614","resolution":{"observed_at":"2026-08-12T16:46:09.993708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.514448Z","title":"Dreamfusion: Text-to-3d using 2d diffusion","venue":null,"work_id":"43a4d4ad-6205-4493-9e8b-1e3b72612112","year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:09.998127Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:03ffdd8543db0967d9088fa21d25fcb8a221c80322c53d28856e4d39c8d0bc73","observation_id":"eff91478-3e75-408c-bdb3-659c1841506e","resolution":{"observed_at":"2026-08-12T16:46:10.519250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.003200Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.003200Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:9f462c0ddb7b1914effe07b296fe5c5cda6d2d6dfcdea050f1a320ed470aef9a","observation_id":"a5f85f7f-74aa-48fa-8f51-5fd6ca11687b","resolution":{"observed_at":"2026-08-12T16:46:10.003200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.007716Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.007716Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:3219050e2a81f4aa26d11f4007c0d24cb58759872f42d5273811e0fbf8dd0dfc","observation_id":"93103c53-289e-4781-9f83-f5c2f706ebd1","resolution":{"observed_at":"2026-08-12T16:46:10.007716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.012269Z","title":"Language-grounded indoor 3d semantic segmentation in the wild","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.012269Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:b10ebd6071549f60205c87d9940175e2449e7531941ea847e994ec3ba0f27f04","observation_id":"5f773dd6-48f4-4386-964b-6e205659d548","resolution":{"observed_at":"2026-08-12T16:46:10.012269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.469902Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"b46dfac5-dedb-42f1-9ea0-97ab866fb0a9","year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.017134Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:68d5dc7855e81e59824f5949137058a74704d2b7818c11c43b1736761ba37fd2","observation_id":"5828134d-e411-40d1-97c9-7e6bb1c6729e","resolution":{"observed_at":"2026-08-12T16:46:10.474877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.454311Z","title":"Dreamgaussian: Generative gaussian splatting for efficient 3d content creation","venue":null,"work_id":"494c7fc0-7379-482f-bccd-0e2c31227c3c","year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.022245Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:49ee6f00463b0a941659292f03d2f87a08d490cb6657b2b2541c942627875ddf","observation_id":"c446b89e-62ed-4580-aed1-8e2b4e6153ed","resolution":{"observed_at":"2026-08-12T16:46:10.459203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.438865Z","title":"Diffumask: Synthesizing images with pixel-level annotations for semantic segmentation using diffusion models","venue":null,"work_id":"377bb58e-160a-43ac-8c80-364a3c8d44d1","year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.026793Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:3f9f11a593c42377543d3d2276ab3f77b7171586874f6d0f0a8b4e6829fe5e66","observation_id":"0a64c565-b35d-4415-8c8b-44523533772f","resolution":{"observed_at":"2026-08-12T16:46:10.443737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10035","last_updated":"2024-03-25T16:00:01Z","snapshot_observed_at":"2026-08-13T05:00:43.120608Z","submitted_at":"2023-12-15T18:59:59Z","title":"Point Transformer V3: Simpler, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10035","snapshot_observed_at":"2026-08-12T16:46:10.031420Z","title":"Point transformer v3: Simpler, faster, stronger","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.031420Z"},"links":{"cited_paper":"/paper/2312.10035","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:f68b52b812909f61ac03aa3d946c6a3c684f5ce66081a444b19bbdeaba6d4cbb","observation_id":"1a8875c1-c52a-43e6-ab82-b6701ee2bbdf","resolution":{"observed_at":"2026-08-12T16:46:10.031420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.423764Z","title":"Point transformer v2: Grouped vector attention and partition-based pooling","venue":null,"work_id":"79925c61-a51b-4f1b-8687-2fff48b88dd8","year":2022},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.036429Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:b88361cc9c87b893f9f8a6fad978b16764c74ea4f56356907d349021d83b8d59","observation_id":"3d8920c5-7953-46fd-9a1e-21730a93cf52","resolution":{"observed_at":"2026-08-12T16:46:10.428777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02402","last_updated":"2024-04-03T03:45:38Z","snapshot_observed_at":"2026-08-13T04:48:52.707276Z","submitted_at":"2024-01-04T18:39:32Z","title":"3D Open-Vocabulary Panoptic Segmentation with 2D-3D Vision-Language Distillation","version":3},"cited_work":{"arxiv_id":"2401.02402","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.02402","snapshot_observed_at":"2026-08-12T16:46:10.124977Z","title":"3D Open-Vocabulary Panoptic Segmentation with 2D-3D Vision-Language Distillation","venue":"cs.CV","work_id":"bd59b5b3-3f93-4f72-b118-44438c5fe63a","year":2024},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.041152Z"},"links":{"cited_paper":"/paper/2401.02402","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:a00e246676153c047688e6f8c33b7c4234c2b1fff268f1b6a866e338320bdd83","observation_id":"ef8baa7b-3fbc-47c3-9165-7d2b2eee86a2","resolution":{"observed_at":"2026-08-12T16:46:10.131526Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.045841Z","title":"Open-vocabulary panoptic segmentation with text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.045841Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:98bcc7d8ea462c86499e82b8a3dc14de964eb575bec30b596d606a04eeff6b5b","observation_id":"dac75b9e-69b9-4853-92eb-f52db788d026","resolution":{"observed_at":"2026-08-12T16:46:10.045841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.398767Z","title":"Side adapter network for open-vocabulary semantic segmentation","venue":null,"work_id":"b57ef7a2-1f9c-4765-ae8a-a0be27bfa745","year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.050407Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:9ba5a64a107c1af63c3118a1587dc4a5e21a18a20f80d956eea53b4f854e296f","observation_id":"03402bea-bfa2-402e-ae9a-2c662e1c0345","resolution":{"observed_at":"2026-08-12T16:46:10.403769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00962","last_updated":"2024-05-05T04:44:55Z","snapshot_observed_at":"2026-08-10T03:13:06.322637Z","submitted_at":"2023-04-03T13:30:04Z","title":"RegionPLC: Regional Point-Language Contrastive Learning for Open-World 3D Scene Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00962","snapshot_observed_at":"2026-08-12T16:46:10.054878Z","title":"Regionplc: Regional point-language contrastive learning for open-world 3d scene understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.054878Z"},"links":{"cited_paper":"/paper/2304.00962","citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:c9501c433428b1f70dee1b6e8a8fbb9714e3c9059b20c0ad6b564ac205494917","observation_id":"689b8e2e-4542-48bd-8dce-93e5a4082c8c","resolution":{"observed_at":"2026-08-12T16:46:10.054878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.383594Z","title":"Vit-gpt2 image captioning","venue":null,"work_id":"b32a33b3-094a-4007-bfa0-6f9aee633163","year":null},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.059407Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:92d651db123018245e38a41e89793a19ad9adb6a21a45bf205b4bfade2e787e8","observation_id":"b7a64b4e-a6dd-4b62-ad84-357088974853","resolution":{"observed_at":"2026-08-12T16:46:10.388705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.368539Z","title":"Clip-fo3d: Learning free open-world 3d scene representations from 2d dense clip","venue":null,"work_id":"86fea09c-4eb8-426a-9604-1b2abdc6ff37","year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.063707Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:6908d5ba1d0c9ef13c0df160369245e45f0ad416f6b3685c2fdd94178e93d06f","observation_id":"ab28d98a-0014-4cbd-9097-9372a76f5ca7","resolution":{"observed_at":"2026-08-12T16:46:10.373333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.067942Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.067942Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:0ffb706ee2c0d86afc4f5ab0fec46292008d3cbc0af1c26518182577f7b09898","observation_id":"c7d84e53-af3b-4033-a054-292f1cff11ed","resolution":{"observed_at":"2026-08-12T16:46:10.067942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:46:10.343977Z","title":"Point transformer","venue":null,"work_id":"f57864d3-b242-4687-8f0f-e9bb93da72c5","year":2021},"citing_paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T16:46:10.072459Z"},"links":{"citing_paper":"/paper/2411.13243"},"observation_digest":"sha256:cd47ef45522dd2676fd5a6c557c1b5d483ce9e3dd8b23ae722411621485ed0ff","observation_id":"247efaf2-45f9-4e37-913c-a97bce88aaf8","resolution":{"observed_at":"2026-08-12T16:46:10.348859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.13243","last_updated":"2024-11-20T12:02:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T17:53:17.544458Z","submitted_at":"2024-11-20T12:02:12Z","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":2,"verified_fuzzy":22},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2411.13243."}