{"as_of":"2026-08-10T07:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c23cd4e849fac095b61a486149bd5909e8f95b17787e8db14923f57dadeb461","coverage":[{"denominator":113,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:52:14.978847Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.02548/citation-record","integrity":"/paper/2502.02548/integrity","json":"/paper/2502.02548/citation-record.json","paper":"/paper/2502.02548"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.562340Z","title":"https://huggingface","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.562340Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:44565fb0ff15d8b448075489f76d4b6608d3acf7c63a62c0d0cc9a5a273a7e1c","observation_id":"00e19b1d-8dcb-4811-945b-7b9a620ece04","resolution":{"observed_at":"2026-08-09T11:52:14.562340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T11:52:14.567886Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.567886Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:f9f6aa0a213c6036cd61984e2dbe0089ebcf6d5f352fceafe86177aaa2f80c08","observation_id":"0de5cbea-bd04-4fda-8e9d-fbbf712568fe","resolution":{"observed_at":"2026-08-09T11:52:14.567886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.572923Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.572923Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:03ebecc4c35e32c45bc1e886357c2a36435fb62fea403b71aa2678bf329b7b31","observation_id":"0e29b170-02c0-4df9-bfb0-671e370e82f9","resolution":{"observed_at":"2026-08-09T11:52:14.572923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.577648Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.577648Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:2b7d18a2919c560a40f21f67f0742ff322b43b8c662ed2a294ec5368ff45f77f","observation_id":"3e1d639c-f057-45ae-9757-e97df963a3fd","resolution":{"observed_at":"2026-08-09T11:52:14.577648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-09T11:52:14.581601Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.581601Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:d6b653c833109507a6cdf1ece75eefb8b1bfa47e73506c5823971985212af2f9","observation_id":"4c4b582d-deda-451e-a389-2e911d10581c","resolution":{"observed_at":"2026-08-09T11:52:14.581601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-09T11:52:14.586476Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.586476Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:b55422ea9cb19ce01815189d32d6e86ebdb041aa71ee0b5606d40953aba092bc","observation_id":"0ba80f78-5e9c-4d59-b1a4-d70e6a00b12e","resolution":{"observed_at":"2026-08-09T11:52:14.586476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.590946Z","title":"Arkitscenes: A diverse real-world dataset for 3d indoor scene understanding using mobile rgb-d data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.590946Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:098c4e5148555dbad8e708ca29b4fae839b2730206aa872e42282026fe39e721","observation_id":"3639b949-16f6-4b95-9744-eef372a2b615","resolution":{"observed_at":"2026-08-09T11:52:14.590946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.595991Z","title":"Audiolm: A language modeling approach to audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.595991Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:b0586d3fab2a49fcde079ec8c639f9f54ebd34f387d8eecfb5f0dc3dfd91d5a8","observation_id":"29b0a2c2-4039-427f-8956-128928764e1c","resolution":{"observed_at":"2026-08-09T11:52:14.595991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.600157Z","title":"Large-scale machine learning with stochas- tic gradient descent","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.600157Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:f085f1663d38cc73a8cc5c791801956bd7eb7a2ca6e25e9e389db2c5ff54bc46","observation_id":"d8d940d8-b557-43f7-b49d-8964fbdf988e","resolution":{"observed_at":"2026-08-09T11:52:14.600157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-09T11:52:14.604539Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.604539Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:6ceda0fb31d9f5ba0795bfadac480faf0a8fca1b14382aa652eb020a5918e746","observation_id":"ad369f0b-c399-48fa-95d1-ffc270cccd52","resolution":{"observed_at":"2026-08-09T11:52:14.604539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.609153Z","title":"Coyo-700m: Image-text pair dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.609153Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:5e2b6b89a4bb90b7e178ebde9324d6f64bbe4d1b55382bf630fc74e2005a9353","observation_id":"14e98da3-0684-481e-b882-6cfd28da27f6","resolution":{"observed_at":"2026-08-09T11:52:14.609153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.613366Z","title":"End- to-end object detection with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.613366Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:8adb025d9c6fa2c1ed4726c9d800668ebc7284c3de6f312ff1d17f9fd91a834e","observation_id":"221ae02b-dd6b-4cb6-81c1-a3bb34e3218c","resolution":{"observed_at":"2026-08-09T11:52:14.613366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.617847Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.617847Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:4edde3132f8f44f3938f3e3cf9a8f81684fce3a88efd28823012e92ed033630b","observation_id":"52057327-0ffd-42f7-ae4d-bb2d7947d518","resolution":{"observed_at":"2026-08-09T11:52:14.617847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.622107Z","title":"Matterport3d: Learning from rgb-d data in indoor environments","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.622107Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:db902988b7a153a6687fd7cd76aa0314d237fd43960213082865c27459fab373","observation_id":"a12d3e7a-41c0-4542-990d-1f922873e342","resolution":{"observed_at":"2026-08-09T11:52:14.622107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.626298Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.626298Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:35347e2a7f387c79e40676a0664814adc57160cd0db8ae20555c5a71964dcd99","observation_id":"0b88250b-1c5f-434a-9913-e08b0c1daf13","resolution":{"observed_at":"2026-08-09T11:52:14.626298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.630797Z","title":"Pali: A jointly-scaled multilingual language-image model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.630797Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:6c73f95f8dd20363c158e634be1b92e2a2d29178cf904a3aa0013ea483c7cc38","observation_id":"c003712d-e347-4713-aeb7-707cc7e791a3","resolution":{"observed_at":"2026-08-09T11:52:14.630797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.634940Z","title":"Per-pixel classification is not all you need for semantic segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.634940Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:55fdc0e19ba100a474338b6c4231e073be41e30138e8917adf7d1d953669eb1b","observation_id":"bfe2f05f-8f82-4f3c-94e2-f244efeae5c5","resolution":{"observed_at":"2026-08-09T11:52:14.634940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.639318Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.639318Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:b9f4e394c987746260310cf2014a414ace9b001d027eea89125815ed3ee63012","observation_id":"f96db358-1b11-4f9d-b955-f74a13d91fa5","resolution":{"observed_at":"2026-08-09T11:52:14.639318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.643885Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.643885Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:d6837cf0f90949828b98d6515322c92b2b20495053703dde8d6a4eb99fca1c0f","observation_id":"2f5ad14a-f21c-4b58-9ee0-b4ff22b0adde","resolution":{"observed_at":"2026-08-09T11:52:14.643885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.648054Z","title":"Cat- seg: Cost aggregation for open-vocabulary semantic seg- mentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.648054Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:2a4276c9ea0122e4a3546361842ba5fcc59487ce9d517e560dcefab75852cd94","observation_id":"6dd0943b-d02f-406f-a495-24fdc474956f","resolution":{"observed_at":"2026-08-09T11:52:14.648054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.652521Z","title":"4d spatio-temporal convnets: Minkowski convolutional neural networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.652521Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:aa81e5d17b748f2f3426412e53b4bbd033f323ed50f70cb0c1bbdb0e81687862","observation_id":"0cd8e49c-106c-4e32-8721-6a31597b6b33","resolution":{"observed_at":"2026-08-09T11:52:14.652521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.656602Z","title":"Scaling instruction- finetuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.656602Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:c6e0798f41d39d42f3f8c5a2563d74b8757198fdae53d53f87adc92ea114202a","observation_id":"4fef109b-e5a2-4649-af72-6c41e31eaafb","resolution":{"observed_at":"2026-08-09T11:52:14.656602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.660694Z","title":"Pointcept: A codebase for point cloud perception research","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.660694Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:593a95f951daab07a88c526380ac36c1b7217a9313ba5404030329e433b0eb03","observation_id":"cf04d106-fd56-40a3-a7d0-198382c3c0c7","resolution":{"observed_at":"2026-08-09T11:52:14.660694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.664581Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.664581Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:2501695468f19a625819154ab8274fe2f624ac156b463f5fe15eef84789afa52","observation_id":"dcbaa040-18d9-4e97-9961-aa7248af709c","resolution":{"observed_at":"2026-08-09T11:52:14.664581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.668572Z","title":"Procthor: Large-scale embodied ai using procedural generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.668572Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:59403f71f5d73c454461516d0c484f081c3c6d66e1026118b49744c4f6d6fbc4","observation_id":"853ff7e2-95c8-42b9-907e-7b55d17ea351","resolution":{"observed_at":"2026-08-09T11:52:14.668572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.672837Z","title":"Pengi: An audio language model for audio tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.672837Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:a932f1f58546c06f244204de6eaaf99d531d621279fa5e63c89c179176f38498","observation_id":"a9b89b0c-746c-44c2-9241-9152b147eca2","resolution":{"observed_at":"2026-08-09T11:52:14.672837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.677012Z","title":"Pla: Language-driven open- vocabulary 3d scene understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.677012Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:251f7876ed71ab0fb63741b98676a1ca17fc0b8d762f7967a886b8becb9bb016","observation_id":"874ef941-752f-4003-b50c-849466114b63","resolution":{"observed_at":"2026-08-09T11:52:14.677012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T11:52:14.681025Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.681025Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:906aa8d1ae650430113f6cba559e7fbdae7041eab24e314cf10858926e763ebc","observation_id":"90edc446-c1b2-4171-a472-a8a6645caadf","resolution":{"observed_at":"2026-08-09T11:52:14.681025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.685595Z","title":"Efficient graph-based image segmentation","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.685595Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:f4bf9b3b3962ff4451c4c923b88d183abd2ad7a866f17216a0ce1fd911438899","observation_id":"d2a0e2a6-2a47-4af7-a4d8-2eaa6b1782f0","resolution":{"observed_at":"2026-08-09T11:52:14.685595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.689680Z","title":"Dat- acomp: In search of the next generation of multimodal datasets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.689680Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:b17988182667bf410aed7846ea1ba04fad8bdb3c7a8c334a2fb916e5ce5b8504","observation_id":"e7bb280a-4088-4615-a105-42f71715cb38","resolution":{"observed_at":"2026-08-09T11:52:14.689680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.693601Z","title":"Scal- ing open-vocabulary image segmentation with image-level labels","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.693601Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:0154b85cb2be2e84fdbd57ccb63fe57d613934effe92504571064661a431dce4","observation_id":"affb818f-864c-437a-8742-acb3439b38eb","resolution":{"observed_at":"2026-08-09T11:52:14.693601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.697384Z","title":"Imagebind one embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.697384Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:6f529f48036896cc04eddcdb1b0a68f625a97e86d06fa9f5348edd6b0426cdb9","observation_id":"82c286eb-35b4-447f-9fd1-96c11635699c","resolution":{"observed_at":"2026-08-09T11:52:14.697384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.701027Z","title":"3d semantic segmentation with submanifold sparse convolutional networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.701027Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:193aec9b0d18a3599858a9380b8167b868a4bf72e72541216fe9aa64c2f3bf55","observation_id":"80b722c7-3dac-4852-8e14-757d560df0e8","resolution":{"observed_at":"2026-08-09T11:52:14.701027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.705118Z","title":"Open- vocabulary object detection via vision and language knowl- edge distillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.705118Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:24fb4796eb5057ec13b02ecb53dd3977622f1527e1e9dfc57436dbcf27cc390e","observation_id":"275aa17b-4b30-422c-8f52-a1ebc99847df","resolution":{"observed_at":"2026-08-09T11:52:14.705118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02330","last_updated":"2024-03-04T18:58:08Z","snapshot_observed_at":"2026-08-04T19:14:19.335752Z","submitted_at":"2024-03-04T18:58:08Z","title":"RegionGPT: Towards Region Understanding Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02330","snapshot_observed_at":"2026-08-09T11:52:14.708786Z","title":"Regiongpt: Towards region understanding vision lan- guage model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.708786Z"},"links":{"cited_paper":"/paper/2403.02330","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:4bc07c343c5c2534851658bd9911c1a71ff0d8552278fbf1621983132bedc9a3","observation_id":"29f12a23-69f1-4df5-9e6f-7afb377fbebb","resolution":{"observed_at":"2026-08-09T11:52:14.708786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.712783Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.712783Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:e31f0782d092e6b3643cdff4008e8518b1e5c4a93856ae7dbeefe703460bc7a8","observation_id":"06895320-52ee-4f98-90a0-bc1db054f058","resolution":{"observed_at":"2026-08-09T11:52:14.712783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.716714Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.716714Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:867415aafda1f6c157ea7ff9eb476df990f462d1816bb0e0616dfa6e15d6c5cc","observation_id":"a3949f46-5039-46ba-9463-e09527f2f633","resolution":{"observed_at":"2026-08-09T11:52:14.716714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.720613Z","title":"Scaling up vision-language pre-training for image captioning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.720613Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:78260b3936580f3b8204ec489ba1c046d73d4b46f03b2e0612d48e55a654cf81","observation_id":"cecbf8e7-2c25-4899-93dc-25671c5a93bb","resolution":{"observed_at":"2026-08-09T11:52:14.720613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.724428Z","title":"An Embodied Generalist Agent in 3D World, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.724428Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:ae7046cad209c3f321c4031831d512b7438e0b9658989f0fc0811739a314e607","observation_id":"a74ad816-a918-4526-bef7-94ef9b703b70","resolution":{"observed_at":"2026-08-09T11:52:14.724428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.263203Z","title":"Segment3d: Learning fine-grained class-agnostic 3d segmentation without manual labels","venue":null,"work_id":"9250efd7-d6ad-4510-8832-717250508967","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.728313Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:c81ff3f0b14fb8ac6a88803031ac59cc960174d8d05519337aeb726efb45c14e","observation_id":"cfc6e54a-bb57-437c-9fab-32911b613dc9","resolution":{"observed_at":"2026-08-09T11:52:16.268078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.248009Z","title":"Open-set image tagging with multi-grained text supervision","venue":null,"work_id":"ef52bc41-0b2f-4e91-9b35-81a89267ca03","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.732287Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:7d7d9060f8f6c6cee9fa6b96f747af184551ef256492ee61ff22d4ab1e33b6f8","observation_id":"bfa33195-a310-44db-ab51-a169911857d5","resolution":{"observed_at":"2026-08-09T11:52:16.252677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.232814Z","title":"Openins3d: Snap and lookup for 3d open-vocabulary instance segmentation","venue":null,"work_id":"4c3ccba2-fe4e-436a-b859-4a35c0e3ea92","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.737048Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:cf70deb855490451ffc0cf8c52dfbd2578c62ce7df913ced44e8ab604954785d","observation_id":"daf2bf4e-38a0-4e7a-8daa-9dfb26f4a3d0","resolution":{"observed_at":"2026-08-09T11:52:16.237410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.741058Z","title":"Oneformer: One transformer to rule universal image segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.741058Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:8000e2cb2a387463a72818fc8f623c7703db8f48ed27089397f3514e12c70ca9","observation_id":"b9c9593d-abe8-4039-91b1-fee9aa4083a0","resolution":{"observed_at":"2026-08-09T11:52:14.741058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.205291Z","title":"Scen- eVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding, 2024","venue":null,"work_id":"f97ec307-d39d-4505-bb81-5d5c1241bd06","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.745098Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:7cc856b14051bc02d3466c8a4d692b3ba7860447d6655017f0811d1c327c77dd","observation_id":"4a45b972-ec9e-4c94-aa03-1ec35f0ccc6b","resolution":{"observed_at":"2026-08-09T11:52:16.210733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.749054Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.749054Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:ea31acc6db4a2427b2d68f52578b0de9aabfc28036f8fc25226bc890f1c6ff57","observation_id":"e412da27-9b92-4f97-a127-2174cc369ab5","resolution":{"observed_at":"2026-08-09T11:52:14.749054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-09T11:52:14.753930Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.753930Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:a96d317f9d620c50d729d01a398cd268c4e0bf14411c91c7c5a0e35567ef94eb","observation_id":"97cd7bfa-79b8-40f6-83a8-69edb7645e72","resolution":{"observed_at":"2026-08-09T11:52:14.753930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-09T11:52:14.758083Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.758083Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:e212ee1a90d2ea4779c57a44ad3678c55625f830eee8f2eff3ab247a396260dc","observation_id":"a96f6ac5-9a3b-4aa2-b53e-1f4f34c88b0c","resolution":{"observed_at":"2026-08-09T11:52:14.758083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.178537Z","title":"Open-vocabulary 3d semantic segmentation with foundation models","venue":null,"work_id":"93bb877a-d879-4aa4-a015-53d5b9201bb4","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.762576Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:77933f9247fe858e5953053054f89c8429b55e5a6069121b29c08a5439c86f75","observation_id":"42d0e6dc-74c8-426e-a0cf-35e1a991544c","resolution":{"observed_at":"2026-08-09T11:52:16.183318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.163359Z","title":"In defense of lazy visual grounding for open-vocabulary semantic segmentation","venue":null,"work_id":"f8015df8-f2c6-4cb4-9eb7-5a6e53458fdf","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.766649Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:971ced71b3880f09f04c6f94ee9de425783174487cb3414f196bf578b547c811","observation_id":"917ac727-ee91-446c-8584-4546bcfa6273","resolution":{"observed_at":"2026-08-09T11:52:16.167880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.149063Z","title":"Segment any- thing","venue":null,"work_id":"5ce378b8-009f-463e-9629-39363b313320","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.770955Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:75035bd11bb828cbd221ac411bfc5aab381452b8b5fc7a89c51b11521b606f38","observation_id":"8d77640e-e6b6-4ee5-a438-891fe4fa787c","resolution":{"observed_at":"2026-08-09T11:52:16.153388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.133902Z","title":"Language-driven semantic seg- mentation","venue":null,"work_id":"e1b4d87f-d4fb-4636-97b5-b53417413176","year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.775337Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:8476f534f723e7cb48d92bd782135533d02d587be9698260ec97e8d76b477ca4","observation_id":"4c119a91-cee5-4b8d-ac9f-154d3a7c83aa","resolution":{"observed_at":"2026-08-09T11:52:16.138563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.118326Z","title":"Semantic-sam: Segment and recognize anything at any gran- ularity","venue":null,"work_id":"5447de0f-ca94-4d42-8651-0af0b4c03102","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.779553Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:6a01fc2629b14d90ab4517599354655b5947adca56d219e70ef2db49e8b49f9e","observation_id":"66a26ccf-570b-4106-bad7-c82817705a69","resolution":{"observed_at":"2026-08-09T11:52:16.122887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.102813Z","title":null,"venue":null,"work_id":"219ded9b-bdda-4d94-95a1-b2732ae9d327","year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.783713Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:2a7dfa6455eeaca8b945abe3388d2e6666a5037282e88f6e9365c1a11a16e19f","observation_id":"bd214a08-26b4-432c-a489-3fb65d964819","resolution":{"observed_at":"2026-08-09T11:52:16.107193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.084833Z","title":null,"venue":null,"work_id":"9a77fb3e-ca32-402f-9d5f-7a10477c8e45","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.788044Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:a6749ec7e135d9b496496a377dec1491f9efbd3d24a7957d542f9e8bb1c5ac2e","observation_id":"4d3bdca8-f72a-4e4d-8435-bdcf36ef16e2","resolution":{"observed_at":"2026-08-09T11:52:16.090482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-09T11:52:14.792125Z","title":"What if we recaption billions of web images with llama-3? arXiv preprint arXiv:2406.08478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.792125Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:38df75a3d5fee1b4953c56d060dc0806abf7ab8152b482000cbff43547f0a4dd","observation_id":"7d1262d9-2858-43e1-ad4d-6566f6f7459e","resolution":{"observed_at":"2026-08-09T11:52:14.792125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.068824Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":"f06d483f-12b7-45c7-a2c0-9b2486d69570","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.796758Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:70f57bb3ff413a876105230e6614363599f35593670996091e63e98a27b43d50","observation_id":"8d8d16bd-341f-4c4e-84f8-b04f7a8fb787","resolution":{"observed_at":"2026-08-09T11:52:16.073384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.053328Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"999e6f1f-941a-4b56-9b53-c645dd6219c1","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.801329Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:a88374f09d1f01f7cdfc097ee79e4b9fb7a13b52e951d32c14e1d16a88749950","observation_id":"cafe5ede-5d40-403f-86f5-78a1cc20a36f","resolution":{"observed_at":"2026-08-09T11:52:16.057811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.038324Z","title":"Visual instruction tuning","venue":null,"work_id":"4483c6a8-2051-431f-bf3f-8f4402d6357d","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.805634Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:fa8a0d9516a6b03d737da2ab43dfea6ce93144f4f510e4bcebd5e697be424a23","observation_id":"62176497-bbee-443c-b9d7-63956413a7b2","resolution":{"observed_at":"2026-08-09T11:52:16.042655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-09T11:52:14.809674Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.809674Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:37af8ca97e9ff85783cd43528a006e58baec9a02b4c3a2d9275dc7db9298d798","observation_id":"944f78de-385d-4098-9ecf-8240a8a9d096","resolution":{"observed_at":"2026-08-09T11:52:14.809674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.022498Z","title":"Mmscan: A multi-modal 3d scene dataset with hierarchical grounded language annotations","venue":null,"work_id":"82d8e7d1-c22c-42e9-b7d7-2d128c01e829","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.813845Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:168a96136b9dff0f496bf6238886785632268b96601228e67c5ac3f0eb5c54b7","observation_id":"a038eb75-8d16-46f8-a685-26915a8ddbf2","resolution":{"observed_at":"2026-08-09T11:52:16.027246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:16.006900Z","title":"Multiscan: Scalable rgbd scanning for 3d environments with articulated objects","venue":null,"work_id":"61dfbb27-e8ef-411b-b458-95cdab313ee2","year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.817951Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:43a81c2dc32a090877d86ebf7e5f13699ad8cd82dc90fd0b84d5b59027972126","observation_id":"8a65f695-9d47-4f26-9e95-0e56413c5246","resolution":{"observed_at":"2026-08-09T11:52:16.011839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.821919Z","title":"V-net: Fully convolutional neural networks for volumetric medical image segmentation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.821919Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:b0ae36ece47792ddb3eb487f2c43b539fe023aaa43a82d9cb9d18873d1c6564a","observation_id":"0ef770a6-86a3-494f-bfaa-2c53ab59a942","resolution":{"observed_at":"2026-08-09T11:52:14.821919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.978055Z","title":"Silc: Improving vision language pretraining with self-distillation","venue":null,"work_id":"2e7c2cbd-53ce-465d-bb88-815e951848f9","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.826052Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:8c1d2f7be2557205838c02139fffe6bcb8749888ca3cc44eb287b2e483080635","observation_id":"4f8d6c61-81f5-4fba-bf9e-c89c1417b0c3","resolution":{"observed_at":"2026-08-09T11:52:15.983110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.962298Z","title":"Isbnet: a 3d point cloud instance segmentation network with instance- aware sampling and box-aware dynamic convolution","venue":null,"work_id":"73ac636c-53e5-4834-9494-4c88453dfed9","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.830000Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:824f92fc7572f7589d770b6451b3287b1975617a86d83c6c254be9dbab4e62ab","observation_id":"d331ff8d-a1fd-4598-8940-d1f297e3f0e6","resolution":{"observed_at":"2026-08-09T11:52:15.967578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.946851Z","title":"Open3dis: Open-vocabulary 3d instance segmentation with 2d mask guidance","venue":null,"work_id":"e2ef6d23-23bb-43e8-96ed-8b39b124f757","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.833920Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:cdc786755b5c4fd7de3120cfa972835e3275d9eb9c7704e570ed75268b82724b","observation_id":"52f7004c-a463-42a1-bf5f-11bcb7e40aa8","resolution":{"observed_at":"2026-08-09T11:52:15.951605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.838076Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.838076Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:de84a3dd9193772ad0d1a349193a9de8b0342b6ac8b15c5fe2245b7dcdf8f6db","observation_id":"db49205e-1102-46ab-ae86-1f6b00356dcc","resolution":{"observed_at":"2026-08-09T11:52:14.838076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.922685Z","title":null,"venue":null,"work_id":"a8b6e378-dd09-46d8-b921-3330eebe8b67","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.842102Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:d208264eb07c5b1937e353e433593708585774201dfa8cff74d9899af7042893","observation_id":"437c7dd3-6051-45ba-9b30-a6969133c011","resolution":{"observed_at":"2026-08-09T11:52:15.926916Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.906814Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":"e2298f09-4085-4e4b-9558-0d2a46d1a6a1","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.846000Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:6b70320874e8e78bc9e2e57b030a4c849c10951c6b9634d8ab23f49d0b055e5e","observation_id":"227a1564-54f1-4295-aa9e-21da05878fa6","resolution":{"observed_at":"2026-08-09T11:52:15.911926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-09T11:52:14.850056Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.850056Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:d1d81c44fae0ff21903408ef3c7b520bdb7678036e5d6cb77baf3124d654c97f","observation_id":"e3969332-b124-442c-9ea3-239664801938","resolution":{"observed_at":"2026-08-09T11:52:14.850056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.890427Z","title":"Language models are un- supervised multitask learners","venue":null,"work_id":"bde96e0a-34a1-4e0c-9ae0-f784368fae2e","year":2019},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.854046Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:e984762d5fe39b8f54252b2b9584773f4f86fa7cd04c57af9e3ad00d02c81cbb","observation_id":"22966ade-2886-49b3-abe2-24aae0b57603","resolution":{"observed_at":"2026-08-09T11:52:15.895454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.858027Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.858027Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:1fd38afdabbac415013ec722e8caa1b304b75d133bd71b787c5b9aabe707726c","observation_id":"de4e563d-3480-4b5d-8558-0a78c389876e","resolution":{"observed_at":"2026-08-09T11:52:14.858027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.863566Z","title":"Habitat-matterport 3d dataset (hm3d): 1000 large-scale 3d environments for embodied ai","venue":null,"work_id":"380c849c-3706-4d7a-903b-fc340215d45e","year":2021},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.862319Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:da3e1ea1b12b9bec5503f2059a4486a2d6fef5d6ac43709e0ece147241748bdd","observation_id":"dbc9ddaf-8ff0-46df-b640-d0ec3ed21df0","resolution":{"observed_at":"2026-08-09T11:52:15.868396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.848111Z","title":"Denseclip: Language-guided dense prediction with context- aware prompting","venue":null,"work_id":"140bee28-f67a-47c8-a775-44aa0aecb873","year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.866163Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:b76dfbadaaec4e5c00d4cc985e00da8dd5d708a00619c9c9ec6194b82812bf86","observation_id":"7e015112-44c9-4cd7-b4a4-ab2e5fb1ec0d","resolution":{"observed_at":"2026-08-09T11:52:15.852879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.833738Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":"acc52872-7bfd-483e-ba86-94a5b83272a1","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.870527Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:cf81af2f908bafd654abd31cb636552aceef597985d2aecf568ab9ae5b8e690e","observation_id":"680b86ee-8ea0-4327-b090-2a045849b70e","resolution":{"observed_at":"2026-08-09T11:52:15.838090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-09T11:52:14.874411Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.874411Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:f8b84f71cb55ce292b09f16e4c7c9902ef9ccc85b4f3012aab1a7eb9c258ef6e","observation_id":"da088572-6e7b-41b3-bd14-4a7eebcd8b9d","resolution":{"observed_at":"2026-08-09T11:52:14.874411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-09T11:52:14.878648Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.878648Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:308b3d13d64b3ed9866535403fefaa56a8f1f13db192d0a86c25633855f80f50","observation_id":"bea92ce4-0e2f-48d5-bfc5-03a1add15019","resolution":{"observed_at":"2026-08-09T11:52:14.878648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.882773Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.882773Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:d8b2fd3008436f59a0a911b6448625367f82086166bebfe322f035f20ffa5ad3","observation_id":"7479ea9b-c09b-45e0-9c16-0c470f089aaf","resolution":{"observed_at":"2026-08-09T11:52:14.882773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.807899Z","title":"Language- grounded indoor 3d semantic segmentation in the wild","venue":null,"work_id":"e0486d35-cad3-4c06-9293-12945ace6909","year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.887128Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:d3d3d4532ee1b54902b52d1c00525b9923b03ead86ae80140a3c9595ad011564","observation_id":"0ac63485-9b44-4471-86aa-71f807630c69","resolution":{"observed_at":"2026-08-09T11:52:15.812509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-09T11:52:14.891226Z","title":"Audiopalm: A large language model that can speak and listen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.891226Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:7497944e39a4891a6e8222dab657b9c599f7ac6a48064ffe53a1fed94a94ebe3","observation_id":"b75cad6e-adb1-4754-95cd-024c8708cfb9","resolution":{"observed_at":"2026-08-09T11:52:14.891226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.791804Z","title":"A multi-view stereo benchmark with high- resolution images and multi-camera videos","venue":null,"work_id":"1a608b47-8745-4b19-bd4e-2c61d32388be","year":2017},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.895671Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:53ef88a594e8b770549b45beded6f9268bf1f827580559d87b848b4eaad39b92","observation_id":"eba8f216-4af8-4c68-a3f2-efbf85eb62a0","resolution":{"observed_at":"2026-08-09T11:52:15.796445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.776771Z","title":"Laion-5b: An open large-scale dataset for train- ing next generation image-text models","venue":null,"work_id":"628994bc-2e75-4948-8595-0185c294cee8","year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.899890Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:d44e1d06152becabc239a2352ecd59e9c96f51df4ae24a3a627fe1fdb57b4161","observation_id":"bd752179-a75a-4e49-ba6f-49596dfcaea6","resolution":{"observed_at":"2026-08-09T11:52:15.781293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.761668Z","title":"Mask3d: Mask trans- former for 3d semantic instance segmentation","venue":null,"work_id":"a3cd6352-4fd2-494a-9e49-ab5a7414e2ba","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.904387Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:ea01c647e5cdd090b6db426462705d2b26d2f9e6716dcf19a16f48556d6a4ef4","observation_id":"d72dade2-eaf3-41b5-99fb-0a94abe84dc8","resolution":{"observed_at":"2026-08-09T11:52:15.766568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.746822Z","title":"Clip-fields: Weakly supervised semantic fields for robotic memory","venue":null,"work_id":"ecd8e68b-57cb-4ddb-8e7f-660ddde3b1b6","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.908510Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:15f1bb83372b377660e5f55462f5e0d29600106d7557b116fd41b1879802bc84","observation_id":"23570bcc-5127-4d60-a5d3-c548bbd66bc3","resolution":{"observed_at":"2026-08-09T11:52:15.751438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.731916Z","title":"Super-convergence: Very fast training of neural networks using large learning rates","venue":null,"work_id":"bb5d7e48-125b-4371-b053-2579d5df89eb","year":null},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.912701Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:1346712ce28628fda0d53d72af8cec0554c5df3e5a6a355aaf2008971d7c757a","observation_id":"2ba6bcdc-5af8-442d-adf5-0b97d7c0c9fc","resolution":{"observed_at":"2026-08-09T11:52:15.736995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:14.916736Z","title":"Denois- ing diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.916736Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:c5ff4ef63cadb763eac05a4b51ed4de1d3d5afd6193fc43afcedc01112652f2d","observation_id":"9053103e-006e-4379-8a24-b4af73fafbb2","resolution":{"observed_at":"2026-08-09T11:52:14.916736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.707877Z","title":"Score-based generative modeling through stochastic differential equa- tions","venue":null,"work_id":"527b1d3b-090d-41c6-87f2-04cca12cba5c","year":2021},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.920752Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:9f1e3a479808d6c3d96e80087339c77a555159fe8dfb41116b4f7f52e44c6882","observation_id":"6e7b02f5-b163-4c87-a68f-c672a457b773","resolution":{"observed_at":"2026-08-09T11:52:15.712154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.693610Z","title":"Open- mask3d: open-vocabulary 3d instance segmentation","venue":null,"work_id":"1f1efb6e-79c7-4069-8a7a-d2f7a3e9380d","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.924759Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:adbe279281472288f1718a1ea5fb5682a2b94e622a6de819bbe70552ab17e1a1","observation_id":"dc84ceaa-8ca9-4668-ae2d-b27557d85d5b","resolution":{"observed_at":"2026-08-09T11:52:15.697981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-09T11:52:14.928740Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.928740Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:f50a05803f897965c0c943e50e511f9f37cf31e20d24277a0ad11e789893311d","observation_id":"90173931-af52-49d2-824e-73679f5b0cc6","resolution":{"observed_at":"2026-08-09T11:52:14.928740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-09T11:52:14.933150Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.933150Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:c402d6b00b29ad21d283f0b56b9a0f84e73af0ec3a2bae4d375444524bd2366c","observation_id":"af2fa7ac-9477-476a-a3d5-343a25669593","resolution":{"observed_at":"2026-08-09T11:52:14.933150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-09T11:52:14.937675Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.937675Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:aca23227b2707aabb67c15f80ee525f67014d659ff422ec2d0fffa8db3cc62c1","observation_id":"3713a9ab-650f-44a5-9ac9-244e55a82ef9","resolution":{"observed_at":"2026-08-09T11:52:14.937675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-09T11:52:14.942007Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.942007Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:67d390e2d4e44391e3f0e7cf3260e3e18c9be329910e7345b9211cecf3716959","observation_id":"f4414da6-319f-434a-9e94-603cb6c7a9c9","resolution":{"observed_at":"2026-08-09T11:52:14.942007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.679837Z","title":"Rio: 3d object instance re- localization in changing indoor environments","venue":null,"work_id":"5dba5176-eb8a-4537-beca-9fc060016ef3","year":2019},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.946399Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:bd1b016faa9366493b11357c40e4c96dce7bf1819da86e281560f00bca7fee34","observation_id":"188efec1-78d5-45b2-b1e5-ce0fcf114127","resolution":{"observed_at":"2026-08-09T11:52:15.684118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.665826Z","title":"Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learn- ing framework","venue":null,"work_id":"5fc3485b-7be5-48ce-92ab-b63930fd4226","year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.950455Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:9ebff2445fb37e690339056475465cf565b22e6c4aa63977689e2653f4119700","observation_id":"6a5fa897-59a9-4aa5-9e79-71927bfd4a50","resolution":{"observed_at":"2026-08-09T11:52:15.670541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.651353Z","title":"EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI, 2023","venue":null,"work_id":"1a3fc77d-1a26-4b05-837d-1b3eda5de4e5","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.954462Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:69d6702045e51d9f093c2a5d9f22c1b48b2c7f49af2b5a585b90cf68bb98f8e3","observation_id":"36b75abf-d93b-40da-a930-dae7958998e8","resolution":{"observed_at":"2026-08-09T11:52:15.655917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09718","last_updated":"2024-07-21T20:50:06Z","snapshot_observed_at":"2026-07-06T16:07:49.197575Z","submitted_at":"2023-08-18T17:59:57Z","title":"Towards Large-scale 3D Representation Learning with Multi-dataset Point Prompt Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09718","snapshot_observed_at":"2026-08-09T11:52:14.958546Z","title":"Towards large- scale 3d representation learning with multi-dataset point prompt training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.958546Z"},"links":{"cited_paper":"/paper/2308.09718","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:d5d3d217f47db98aa46f044c5770943f5579e999a87bcc8ae380628117c7bf8d","observation_id":"1e765161-49db-4cfa-b061-16ce0c0d2cd3","resolution":{"observed_at":"2026-08-09T11:52:14.958546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.636969Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":"1410ba11-0985-4d2e-a121-1772b34c7d69","year":2022},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.962797Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:d2889491515c938c02765a0a4cf56fe2c5f3e799c70c356943f7c0771c78e7d1","observation_id":"6d02b364-431b-4fcb-9a34-24d44812b2f1","resolution":{"observed_at":"2026-08-09T11:52:15.641360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-09T11:52:14.966702Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.966702Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:e0a293398cefad0d1e7da9fa4de295600fe50308fb5c0b0593479707f8e5be8b","observation_id":"8efbfbf8-8e95-46fb-9a5c-67288c2bc6d8","resolution":{"observed_at":"2026-08-09T11:52:14.966702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.622072Z","title":"Regionplc: Regional point-language contrastive learning for open-world 3d scene understanding","venue":null,"work_id":"0e2411f8-7a12-4426-80f2-acffa2145dc4","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.971103Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:abb67c9f172d8bd6522421096814447713749f9050330c535655857660cf20b8","observation_id":"9b00930e-bdc8-4255-a703-030886c09744","resolution":{"observed_at":"2026-08-09T11:52:15.627270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.607972Z","title":"Scannet++: A high-fidelity dataset of 3d in- door scenes","venue":null,"work_id":"8909cba9-78e3-4cc7-aea8-60abb2871064","year":2023},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.975066Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:4a7c48c59299b78de3114e7144845bcc2758f0907b630b3046ed6978f3ae55c6","observation_id":"3b50bde3-04dd-4cc0-8a10-3c8987d93792","resolution":{"observed_at":"2026-08-09T11:52:15.612383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:52:15.593616Z","title":"Sai3d: Segment any instance in 3d scenes","venue":null,"work_id":"3ee213cb-2e2e-4208-983f-32eec6111aca","year":2024},"citing_paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-09T11:52:14.978847Z"},"links":{"citing_paper":"/paper/2502.02548"},"observation_digest":"sha256:d90bdfd11ad7f74fce43958dec1bbde0bf16d92580c6159ca82b8bc886346c90","observation_id":"5879e755-4333-4f1e-968f-6e636d3a7a22","resolution":{"observed_at":"2026-08-09T11:52:15.598253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.02548","last_updated":"2025-04-14T18:27:02Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T07:05:41.212457Z","submitted_at":"2025-02-04T18:18:50Z","title":"Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":113},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 113 outbound references and 0 inbound Pith citation observations for arXiv:2502.02548."}