{"as_of":"2026-08-18T08:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:12523ca21ba4a18ed4b305a14a137d334ebfce5edf5765b40d4e1c5a0064215e","coverage":[{"denominator":98,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":98,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:58:28.684524Z","state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.19500/citation-record","integrity":"/paper/2504.19500/integrity","json":"/paper/2504.19500/citation-record.json","paper":"/paper/2504.19500"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:27.064439Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.064439Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:5317e0229acf647976a4b796bc220efd989daf37456f384a415a2ea44dfd337b","observation_id":"38265fd2-bf84-4720-96fa-a5b0ea65c3b5","resolution":{"observed_at":"2026-08-16T05:58:27.064439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-16T05:58:27.068692Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.068692Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:06814834eb77f5db097b5a1fd045022055fc444726fba11a5fb540c88f837621","observation_id":"7af9f3da-38f5-4351-adda-614c0e9f1eb5","resolution":{"observed_at":"2026-08-16T05:58:27.068692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:27.072585Z","title":"Arkitscenes: A diverse real-world dataset for 3d indoor scene understanding using mobile rgb-d data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.072585Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:d5ded1a8261e816a5e371e781b39d84ed91ffb9f617c76acd28604a36977e5ae","observation_id":"1129ef08-b7be-4e72-9665-e905db17e6b2","resolution":{"observed_at":"2026-08-16T05:58:27.072585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:27.077595Z","title":"3djcg: A unified framework for joint dense captioning and visual grounding on 3d point clouds","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.077595Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:f320d2492f00ca7df90898a86149e1bae1d4c0bbd54ab394626b49c968010680","observation_id":"f562cf5e-636a-4c0b-b3ab-0d724ee87149","resolution":{"observed_at":"2026-08-16T05:58:27.077595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06158","last_updated":"2017-09-18T20:34:48Z","snapshot_observed_at":"2026-08-18T04:48:01.891163Z","submitted_at":"2017-09-18T20:34:48Z","title":"Matterport3D: Learning from RGB-D Data in Indoor Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.06158","snapshot_observed_at":"2026-08-16T05:58:27.082358Z","title":"Matterport3d: Learning from rgb-d data in indoor environments.arXiv preprint arXiv:1709.06158, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.082358Z"},"links":{"cited_paper":"/paper/1709.06158","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:01db3d2ffa7e19a0b716bea32967bf091f083ee2b177ae9d0058222d78c3dcc1","observation_id":"0e1a7024-04a5-46b2-a928-2df69eb28251","resolution":{"observed_at":"2026-08-16T05:58:27.082358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:27.086644Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.086644Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:b79ec95565a284fc5e5bfa216f6889714ba789f297d9057044bcfdf90cc00bb8","observation_id":"f243a64a-31d8-4373-89c8-3621803e3f75","resolution":{"observed_at":"2026-08-16T05:58:27.086644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:27.090601Z","title":"Clip2scene: Towards label-efficient 3d scene under- standing by clip","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.090601Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:bf4edf7c38033043bbc89d7593d361fc81804801d2b43eef3d96fdc832e2b606","observation_id":"b3ecf1a9-bb75-4eac-8699-52c42db0fe19","resolution":{"observed_at":"2026-08-16T05:58:27.090601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:27.095168Z","title":"Scan2cap: Context-aware dense captioning in rgb-d scans","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.095168Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:4646e712b81d6fecbd6b6730d07666a55cc3b0713da741d2e6d1072f7ce14ca1","observation_id":"5bdb4a93-88d3-41b1-8541-cde6b9893e4d","resolution":{"observed_at":"2026-08-16T05:58:27.095168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:27.134760Z","title":"Unit3d: A unified transformer for 3d dense captioning and visual grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.134760Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:16867dc95d7e329ab0698cb410c1bd6b021a7870aa9c085003162807497595eb","observation_id":"bae31890-7edd-4389-bb9b-24c44fe48eaf","resolution":{"observed_at":"2026-08-16T05:58:27.134760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:27.207037Z","title":"Cat-seg: Cost aggregation for open-vocabulary semantic segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.207037Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:ee60ca49d235f3eb33a5f37967d5fa981ad483fa90f70af691d5394ed5f5c062","observation_id":"82d1f0b0-fe58-4cd9-b00a-feb4a2712f9a","resolution":{"observed_at":"2026-08-16T05:58:27.207037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:27.357563Z","title":"4d spatio-temporal convnets: Minkowski convolutional neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.357563Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:2277090f5e6632c173cffa6c9686c15f344a4eee9dc1a8669956b3814aa4c8a1","observation_id":"ae81c91b-f8dd-4f11-842a-efd0bbdbde31","resolution":{"observed_at":"2026-08-16T05:58:27.357563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:27.395473Z","title":"Pointcept: A codebase for point cloud perception research","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.395473Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:c3bf2688dcab1684315edec9f8070b94ad89bb161f326e5d3a3794dd79cb559a","observation_id":"7a3fe26b-3a03-4195-8ac8-c442519e6c38","resolution":{"observed_at":"2026-08-16T05:58:27.395473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:27.399178Z","title":"Spconv: Spatially sparse convolu- tion library","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.399178Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:ae4e1b658653b8328045302ba7c0850bbce3fb625a96dceebcee1b0c9f968a31","observation_id":"a62495bc-7196-446e-bccd-5b26d4b46df1","resolution":{"observed_at":"2026-08-16T05:58:27.399178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:27.402574Z","title":"Scannet: Richly- annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.402574Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:1ec26e130a80137dbe4b9881f79c5b4fa8019c084ffb0bc334a6c5ed9ef06844","observation_id":"a5963e24-c8fe-4519-b45d-98e65533c850","resolution":{"observed_at":"2026-08-16T05:58:27.402574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:27.405998Z","title":"Procthor: Large-scale embodied ai using procedural generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.405998Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:3d4bd2a1f813ef220b5be107d2d79f93f6528cc6007cb871a2028c99fa5f9766","observation_id":"f39a7d42-c843-4e03-b11b-1ee301b2097c","resolution":{"observed_at":"2026-08-16T05:58:27.405998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T05:58:27.409042Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding.arXiv preprint arXiv:1810.04805, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.409042Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:dcce52466ff18ac4c7430d15b5d08755b4be98cbad3ced4e08f69306004a0863","observation_id":"afccfc09-1231-4ba9-a200-5ef83d94d643","resolution":{"observed_at":"2026-08-16T05:58:27.409042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:27.412739Z","title":"Pla: Language-driven open-vocabulary 3d scene understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.412739Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:9f891ed3991b969572c78fc3a0825ec1865de4a3e829897646e093191db89a83","observation_id":"fdb49ad8-7c48-4a96-a0b9-25dccc7d53d6","resolution":{"observed_at":"2026-08-16T05:58:27.412739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-16T05:58:27.416304Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.416304Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:54fd92ea3ae1d6671722ae5d366f7f7d806d1a263f4fe8bafe17ae7ba4ad2a84","observation_id":"1d370514-93bd-4b7f-8b55-b7057e849b38","resolution":{"observed_at":"2026-08-16T05:58:27.416304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:27.420081Z","title":"Foundation models in robotics: Applications, challenges, and the fu- ture.The International Journal of Robotics Research, page 02783649241281508, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.420081Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:45e9111797b507a73e18664b0129895c1af2570f009e19408e5f6cf01f07b1f9","observation_id":"9ec085f1-155b-4afa-bb46-02e593b72e16","resolution":{"observed_at":"2026-08-16T05:58:27.420081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-17T15:42:36.096154Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-16T05:58:27.422768Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning.arXiv preprint arXiv:2403.11401, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.422768Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:455850856d78e94c85dddecedf92187ba0f3bf01a1692fa5eccc64aa1c9ac9e5","observation_id":"f8fa74c8-7c73-4319-9885-0f9a1f250a74","resolution":{"observed_at":"2026-08-16T05:58:27.422768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:27.426532Z","title":"Scaling open-vocabulary image segmentation with image-level labels","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.426532Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:b59a879ed8f0f089794757a6ddc6d3e335042a0c0e2d680588e58972e2f0aee1","observation_id":"113ea330-bde1-4bf4-82b9-dbdbc6b2b2ad","resolution":{"observed_at":"2026-08-16T05:58:27.426532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:27.429715Z","title":"3d semantic segmentation with submanifold sparse convolutional networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.429715Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:a0b66ee8ba5418d3968dbd5cfd5a8283112127f36af4e3af9ae1575d9c953dfc","observation_id":"8ad92dc0-61ae-4bf1-b538-acceed9a0f69","resolution":{"observed_at":"2026-08-16T05:58:27.429715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:27.432839Z","title":"Concept- graphs: Open-vocabulary 3d scene graphs for perception and planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.432839Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:9650ea83e64926d7165395ca2fbe1e9fbe33e32305a3a496e79c85f8de9b7434","observation_id":"372c28a3-b51a-4ea6-9ff5-6384925891ee","resolution":{"observed_at":"2026-08-16T05:58:27.432839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-16T15:03:56.512242Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-16T05:58:27.435522Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understand- ing, generation, and instruction following.arXiv preprint arXiv:2309.00615, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.435522Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:c349da7eb7c1b42aff00ad6027b34b9c73a624bb90dfaece8a8f5c468154b838","observation_id":"582c9234-5cd1-4879-b6e5-f2e013dbc122","resolution":{"observed_at":"2026-08-16T05:58:27.435522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:31.086723Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"d6defb5f-ee3f-4d02-a0d1-6131200b92ca","year":2022},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.439119Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:7c01ccdf243ca8078693dd05ae9c6c5a5fa821367771c4e1e01630eccff49ddf","observation_id":"f0eecbbc-e8c3-4072-8d78-529428d28ee4","resolution":{"observed_at":"2026-08-16T05:58:31.090300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:31.074990Z","title":"3d-llm: Injecting the 3d world into large language models.NIPS, 36:20482– 20494, 2023","venue":null,"work_id":"106babf4-b7a1-4d48-8e49-1fe8bdc77b73","year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.442536Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:dbe5fef8c033cf25898255079c7a8276a29e30ef0b754959f92894f1e17b4558","observation_id":"594ef030-55c7-4a45-a9fa-a3be8db2e5d7","resolution":{"observed_at":"2026-08-16T05:58:31.078766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:31.063791Z","title":"3d-llm: Injecting the 3d world into large language models.NIPS, 36:20482– 20494, 2023","venue":null,"work_id":"505b2310-ea52-4bc2-9413-91cdb8796eb8","year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.490563Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:59e4ff432432db9dfa401582f7ea970cfd355dce2195f960a67b87f8836a9696","observation_id":"5fa8346b-1306-4eb7-84e3-367c51b2094d","resolution":{"observed_at":"2026-08-16T05:58:31.067969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:31.052353Z","title":"Multiply: A multisensory object- centric embodied large language model in 3d world","venue":null,"work_id":"0c23b667-dd05-4a42-8e8a-b37ee11e8408","year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.538214Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:e6f745b587a1144515aa145806c97e98718ee0847256936e2e6fab854bfc8aca","observation_id":"e6acafed-ca28-4cc4-8994-295ac792e9b1","resolution":{"observed_at":"2026-08-16T05:58:31.056964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:31.020592Z","title":"Exploring data-efficient 3d scene understanding with 9 contrastive scene contexts","venue":null,"work_id":"9816ff58-eea6-4abe-b79b-1fa5b9d86eac","year":null},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.602360Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:e8d153073969bcdc86757c8df931890006b259b55718c1cb213fb8f6f62796af","observation_id":"cb1c4f3d-9dac-49bd-a38e-d5fe81667875","resolution":{"observed_at":"2026-08-16T05:58:31.044004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.833688Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":"2acfd3b2-3653-4dca-b8a9-1be81cbdbfda","year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.695904Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:bd6498653cbcb46f6758841d11e081f292e6f1593adee0322dca3692a05605fb","observation_id":"c3347c05-161b-4a7a-a0a2-1faf833703b1","resolution":{"observed_at":"2026-08-16T05:58:30.836791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-16T05:58:27.699704Z","title":"An embodied generalist agent in 3d world.arXiv preprint arXiv:2311.12871, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.699704Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:2342b5a6672c39289412fb7eaa413ba21017366b69a3eb5932696d87c61d3466","observation_id":"c142d170-516e-4582-b7a4-dc9b33389961","resolution":{"observed_at":"2026-08-16T05:58:27.699704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.822003Z","title":"Unveiling the mist over 3d vision-language under- standing: Object-centric evaluation with chain-of-analysis","venue":null,"work_id":"6c18860d-efb7-4a47-ab48-5ec15fa9685e","year":2025},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.702747Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:20f7fab4d138385a0c533f9e5627867aad7a846e7e6a71c4d0075e7f69628715","observation_id":"fa3ecb45-f31e-42e1-80e0-522fbace92c0","resolution":{"observed_at":"2026-08-16T05:58:30.827381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.811032Z","title":"Spatio-temporal self-supervised representation learning for 3d point clouds","venue":null,"work_id":"0c96074f-c103-48a2-a7b7-1839b7b0e8c0","year":2021},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.706285Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:e6893df44cefe1a837ac49c9463f031285ac4517c3b5ee7e56bd89ea6cc56cd1","observation_id":"70ea3f8e-dc5b-481c-b524-e9134698b88d","resolution":{"observed_at":"2026-08-16T05:58:30.815516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.801502Z","title":"Openins3d: Snap and lookup for 3d open-vocabulary instance segmentation","venue":null,"work_id":"22351e70-589e-468a-b18a-389558766850","year":2025},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.709530Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:cd7066b6b1a743a7f47b858b91a99c3c7d8875fc981e2f85c64f4258312dbede","observation_id":"c2ea155b-0282-4f18-978a-81bc7ffe347f","resolution":{"observed_at":"2026-08-16T05:58:30.804575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09340","last_updated":"2024-09-24T03:18:24Z","snapshot_observed_at":"2026-08-16T14:26:43.973134Z","submitted_at":"2024-01-17T17:04:35Z","title":"SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09340","snapshot_observed_at":"2026-08-16T05:58:27.712861Z","title":"Sceneverse: Scaling 3d vision-language learning for grounded scene un- derstanding.arXiv preprint arXiv:2401.09340, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.712861Z"},"links":{"cited_paper":"/paper/2401.09340","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:ac852348310c8b7f2b8871222202a4a12b19299c909e3fe17b82f11b129565ac","observation_id":"1e2b678d-1710-4cda-abf8-f2a3d9957f97","resolution":{"observed_at":"2026-08-16T05:58:27.712861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:27.716730Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.716730Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:bbbd65baeac75f96f5b0980e484b7fe5a29eee16ef3d7c459e55a5cd5f719695","observation_id":"61084017-02c1-4262-82c2-96f5b4016848","resolution":{"observed_at":"2026-08-16T05:58:27.716730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.783707Z","title":"Pointgroup: Dual-set point grouping for 3d instance segmentation","venue":null,"work_id":"9295c7a8-d3c4-4e72-82d0-ccac01f22f7d","year":null},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.720904Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:521781812be9ac81849287e8bc9e4e402c5737d8794a1d9afa963327536ab86a","observation_id":"6aacf438-0730-4f42-b12e-d41953f1f5fe","resolution":{"observed_at":"2026-08-16T05:58:30.786978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.771197Z","title":"Open-vocabulary 3d semantic segmentation with foundation models","venue":null,"work_id":"c89f81aa-9bd7-4dd8-9c7a-71f0945b013d","year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.724975Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:820181734581dbabd10f051046b546bf83c0a18ed4204d652c4a85055191ebda","observation_id":"34bed0b6-56f7-4cba-8cd6-b1201b1dbd7a","resolution":{"observed_at":"2026-08-16T05:58:30.776123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00255","last_updated":"2025-02-20T18:06:19Z","snapshot_observed_at":"2026-08-16T13:13:56.200323Z","submitted_at":"2024-09-30T21:55:38Z","title":"Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00255","snapshot_observed_at":"2026-08-16T05:58:27.728279Z","title":"Robin3d: Improving 3d large lan- guage model via robust instruction tuning.arXiv preprint arXiv:2410.00255, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.728279Z"},"links":{"cited_paper":"/paper/2410.00255","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:8e5673882380dcd7752ad64e461a3e54a557da9f9e32b48e2489c3fda510956e","observation_id":"0fd09de1-f7aa-4287-8c72-5ba5e4390ef3","resolution":{"observed_at":"2026-08-16T05:58:27.728279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.658581Z","title":"Segment any- thing","venue":null,"work_id":"172df984-7829-415d-8dd6-8cb386108f85","year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.762323Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:a469f1747b1f417c5c3665512e458d72831b34b7c94226339a8974f7765bca65","observation_id":"35f40d81-70a7-4c1b-a238-fb1638c67e70","resolution":{"observed_at":"2026-08-16T05:58:30.707360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03546","last_updated":"2022-04-03T03:33:43Z","snapshot_observed_at":"2026-08-01T06:14:31.660540Z","submitted_at":"2022-01-10T18:59:10Z","title":"Language-driven Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03546","snapshot_observed_at":"2026-08-16T05:58:27.807699Z","title":"Language-driven semantic seg- mentation.arXiv preprint arXiv:2201.03546, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.807699Z"},"links":{"cited_paper":"/paper/2201.03546","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:7bb966312d4fbea2ec739a8b975a59df759d6f7dce69778d9da08314ab2ada85","observation_id":"a4d29b7b-f67e-4039-9868-c3deb215616d","resolution":{"observed_at":"2026-08-16T05:58:27.807699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.632502Z","title":"Maniptrans: Efficient dexterous bimanual manipula- tion transfer via residual learning","venue":null,"work_id":"c809306b-022f-41f0-93bf-a2fad93ec9bd","year":2025},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.855758Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:e02ed98c12726f6d148b7be79e22cdc242fb7eea6d5d824cc64b1a1927f1d74f","observation_id":"9de54dd7-6ae3-4056-b34b-b9ea586d3c8d","resolution":{"observed_at":"2026-08-16T05:58:30.635965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.621543Z","title":"Dense multimodal alignment for open-vocabulary 3d scene understanding","venue":null,"work_id":"22f43119-efbc-4e05-9321-e21ccc55b7a2","year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.933238Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:7f123391195c94efaa1a56a72db1b0fa3e4f16d6f540c29ec5e865a4a526f27b","observation_id":"5d9069cf-f25c-4a11-90ce-35b19d493b9d","resolution":{"observed_at":"2026-08-16T05:58:30.625079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:28.008889Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.008889Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:c20669a806159de9810649d20c25f5a96dfdf4889a7e9c7507b910c27543716c","observation_id":"688f14b2-f57c-4dc0-8e2a-115204457f8c","resolution":{"observed_at":"2026-08-16T05:58:28.008889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.603392Z","title":"Building interactable replicas of complex articulated objects via gaussian splatting","venue":null,"work_id":"583644a4-5139-4cea-9157-8393d63bc041","year":2025},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.012417Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:9a0b02d06c06b252cde64f2f329a53805b98bbe1e473272a59f70fb04aef0b9a","observation_id":"5e607342-8aa6-4f45-ae19-cda0499f74ee","resolution":{"observed_at":"2026-08-16T05:58:30.607648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.593380Z","title":"Movis: Enhancing multi-object novel view synthesis for indoor scenes","venue":null,"work_id":"35ff9cf3-f42e-4244-87f4-981c07a01403","year":null},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.016033Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:e226286014dc2cdde78b016f90c7e255b443c28d68239441c395e390ef8f781c","observation_id":"c6e99081-f65f-4393-a427-f06713ed89dd","resolution":{"observed_at":"2026-08-16T05:58:30.596817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.581719Z","title":"Ovir-3d: Open-vocabulary 3d instance retrieval without training on 3d data","venue":null,"work_id":"2c861951-0016-4602-9a16-70dea5b76c39","year":null},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.020079Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:1580cc5c4c1ace4ba9b6c5f1350bcc4b8b255828fc6f2ec6cc9b304ff344751c","observation_id":"093762cf-f983-484f-a4f2-8698fcd957e8","resolution":{"observed_at":"2026-08-16T05:58:30.586444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-16T05:58:28.023924Z","title":"Sqa3d: Sit- uated question answering in 3d scenes.arXiv preprint arXiv:2210.07474, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.023924Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:448ec36111aa35136228900739251b87a6b130abc4101b19a76f1f5ba741afbc","observation_id":"91930c99-fbf9-4179-abcd-b596c95a3ee6","resolution":{"observed_at":"2026-08-16T05:58:28.023924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:28.027799Z","title":"When llms step into the 3d world: A survey and meta-analysis of 3d tasks via multi-modal large language models.arXiv preprint arXiv:2405.10255, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.027799Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:4eaab1b0066950237b5b91779e7a21ccab696931a004be73e3eb0e9e61de973f","observation_id":"730252d7-a215-49ee-a4ca-d892a4913615","resolution":{"observed_at":"2026-08-16T05:58:28.027799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.454263Z","title":"Multiscan: Scalable rgbd scanning for 3d environments with articulated objects","venue":null,"work_id":"1f16f05c-65c2-48c7-b1d2-9869f318effb","year":2022},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.031218Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:65106a9bb4ae60f4d78491068141263cd19e59335051c3c2581191d1a5f5331e","observation_id":"6912e089-9502-4e95-aa27-ee1993a738d3","resolution":{"observed_at":"2026-08-16T05:58:30.502185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.327850Z","title":"Occupancy-mae: Self-supervised pre-training large- scale lidar point clouds with masked occupancy autoencoders","venue":null,"work_id":"c9f36f92-9fbb-4112-82d8-81c2651d2c20","year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.034598Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:a8d96d3332f0a70d0cb9b282029fca5e802a44ed461db226441969ffc9bffc75","observation_id":"9194ca88-c5a0-42ab-be8d-cf5e3fdaa6db","resolution":{"observed_at":"2026-08-16T05:58:30.373872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:28.037963Z","title":"Open3dis: Open-vocabulary 3d instance segmentation with 2d mask guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.037963Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:6e5eb0d2bd0291b06d6e3708c5da85ccd06569a8f087aad20d12c4a1636f03e9","observation_id":"9f32ff46-4822-446f-8071-bcfbe9a42857","resolution":{"observed_at":"2026-08-16T05:58:28.037963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.311753Z","title":"Phyrecon: Physically plausible neural scene recon- struction","venue":null,"work_id":"43ba8ef1-735c-4697-a41c-d975ead2b02a","year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.041035Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:d9eb161f41b62ac7b2fa4a7cffa91fa2efd18583f03ec18e42c188cf0e2d81b0","observation_id":"cc28536c-1b91-4aae-930c-617f0eaffacc","resolution":{"observed_at":"2026-08-16T05:58:30.315409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.302103Z","title":"Decompositional neural scene reconstruction with generative diffusion prior","venue":null,"work_id":"67e7dab3-02e5-4111-9a75-8cbf2c285f00","year":null},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.044502Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:0d2aa4d10b570c850138ebc3919218a302d1c744d6b2e685ff0acb6a772a71bc","observation_id":"4091d38f-f5dc-43f4-852f-4dd29d617813","resolution":{"observed_at":"2026-08-16T05:58:30.305959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-16T05:58:28.047947Z","title":"Open x-embodiment: Robotic learning datasets and rt-x mod- els.arXiv preprint arXiv:2310.08864, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.047947Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:f03b6450480a85691a30761f356b2bb99d16edf176d98aae48495776e001977c","observation_id":"39eff41d-26a6-4f37-bfbc-33368219cf26","resolution":{"observed_at":"2026-08-16T05:58:28.047947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.290099Z","title":"Gpt-4 with vision (gpt-4v) system card, 2023","venue":null,"work_id":"246c8b2f-4ce3-4d8c-b3cc-daf6a553e64e","year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.051524Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:db88a157994126c25a1eb3f4cdc62d490947065854a71551909ebf6262eef394","observation_id":"33105af5-5026-44b2-be79-73cf95d79b90","resolution":{"observed_at":"2026-08-16T05:58:30.294773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.257639Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":"3adeb02f-2ac5-404d-ae2c-9d8c5016263a","year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.055025Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:75af93db8fdee4b63c4fc12c4e3c89eeb10da2e7eee17cfd1c4edd6c4ac0bf42","observation_id":"ae3d28a7-a157-4660-89f5-16801ab81e64","resolution":{"observed_at":"2026-08-16T05:58:30.281720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.086833Z","title":"Shapellm: Universal 3d object understanding for embodied interaction","venue":null,"work_id":"c88f1dc2-b46f-42b6-9eba-9ec7d1a46cd6","year":2025},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.057533Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:16a6a69939736e6895479d889b27505e412d73b0faa3d6ea1f4961ab18ca54a2","observation_id":"3514242c-189b-4bcd-bc05-da6a5b38b782","resolution":{"observed_at":"2026-08-16T05:58:30.120521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.075997Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"5cdf7836-291f-4886-b880-58a9d1b044fb","year":2021},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.060634Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:b148de8c8f5fc4063569570ffd35f666e1b2eafa84cbaae4f404adf67722bb51","observation_id":"ace3405f-dfcc-4ab0-a731-891d66dbcd05","resolution":{"observed_at":"2026-08-16T05:58:30.079804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08238","last_updated":"2021-09-16T22:01:24Z","snapshot_observed_at":"2026-08-15T09:50:41.483833Z","submitted_at":"2021-09-16T22:01:24Z","title":"Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08238","snapshot_observed_at":"2026-08-16T05:58:28.063996Z","title":"Habitat-matterport 3d dataset (hm3d): 1000 large-scale 3d environments for embodied ai.arXiv preprint arXiv:2109.08238, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.063996Z"},"links":{"cited_paper":"/paper/2109.08238","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:a6cd1b582bf7c281f213299c69d1cdeb43007d586c70d8d795b34679b7053c3e","observation_id":"586de2a0-e055-4eea-82fc-c8877e04dfda","resolution":{"observed_at":"2026-08-16T05:58:28.063996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.065548Z","title":"Language- grounded indoor 3d semantic segmentation in the wild","venue":null,"work_id":"acaf8e5b-9d0f-4611-ab8b-6e30f9dfc2c8","year":2022},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.067023Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:7ca7624e64b82e07b46c2b83fec7c4992fe82f259512bdb3664b71cf25bfc60c","observation_id":"5ae228f7-2896-4632-a111-684dc6cc0104","resolution":{"observed_at":"2026-08-16T05:58:30.069393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.054673Z","title":"Mask3d: Mask trans- former for 3d semantic instance segmentation","venue":null,"work_id":"310df3e4-be66-41e8-b481-06b6c6b597ed","year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.069852Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:b818539c8caf126386bbc5fb5f1ccf1080ba6ebb0189310e2a432f143a595582","observation_id":"8f9f7f0e-c425-4a0a-8179-3a8ccf316d7f","resolution":{"observed_at":"2026-08-16T05:58:30.058426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.043417Z","title":"Open- mask3d: open-vocabulary 3d instance segmentation","venue":null,"work_id":"4b46e39c-2980-429d-bca6-25c96a595906","year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.073061Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:10e754fbf67656365130e2b2f16e097812b9a9b8748fdebe9315640e7ab89ffe","observation_id":"e28baa2c-f938-4f11-bb3c-0c7783fa0351","resolution":{"observed_at":"2026-08-16T05:58:30.047630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.017307Z","title":"Minigpt-3d: Efficiently aligning 3d point clouds with large language models using 2d priors","venue":null,"work_id":"fd8f8b01-52c2-4b2b-a8c7-a5e7f1a5bedd","year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.086230Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:97d7aae4a5e70d518269de7d7bbfd9441bbc0c2131a5c2217967a0e80ccf74de","observation_id":"5ea2272d-ba49-492e-986b-bb6386fa7a91","resolution":{"observed_at":"2026-08-16T05:58:30.035585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:29.846169Z","title":"Geomae: Masked geometric target prediction for self-supervised point cloud pre-training","venue":null,"work_id":"387bf133-3b6e-434e-b667-b511942d0eda","year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.136299Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:04019245e0e8317b3e2a328b37567da69858cec6587dceb5199a2f953bc2f857","observation_id":"02010a7b-12b0-40bd-969f-927ecd489d55","resolution":{"observed_at":"2026-08-16T05:58:29.942005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:29.750089Z","title":"Rio: 3d object instance re- localization in changing indoor environments","venue":null,"work_id":"c0d301d9-8013-4c17-9cb4-3b7c4bdca1d5","year":2019},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.160645Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:1646f4039b55336afe80d57478129e4f19fc58891e152e5a987c5fc0b60d70fa","observation_id":"49319da8-1243-4d6d-bd92-2e87331dc8d9","resolution":{"observed_at":"2026-08-16T05:58:29.761638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:29.738787Z","title":"Groupcontrast: Semantic-aware self-supervised representation learning for 3d understanding","venue":null,"work_id":"621461da-1cda-4ac0-81c0-fd8c4fd35f65","year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.202180Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:741b30c20b5b53715cce99edcc952a2cb5906b9b908b7afaac6bcc88146f650d","observation_id":"95ed88bf-6851-408c-80c2-e2c66443995a","resolution":{"observed_at":"2026-08-16T05:58:29.742221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:29.728101Z","title":"Open vocabulary 3d scene understanding via geometry guided self-distillation","venue":null,"work_id":"ce3b1cea-61b5-4774-8131-056152669d88","year":null},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.246949Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:d9201ca3f98ce3055ee2764f95e25f1ff48c0f44427a7362ea2bfbc259ecc2cf","observation_id":"c0346087-45f8-4c33-a945-cbd6859c46c9","resolution":{"observed_at":"2026-08-16T05:58:29.731826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:28.297466Z","title":"Embodiedscan: A holistic multi- modal 3d perception suite towards embodied ai","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.297466Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:d3608634a82b9e0a6aecd30799247d87d6be4b6e74f1eb0b5da74498dfa87caf","observation_id":"76d9c71c-1a21-49ef-acf2-7581fad9fca2","resolution":{"observed_at":"2026-08-16T05:58:28.297466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10217","last_updated":"2024-07-22T08:30:53Z","snapshot_observed_at":"2026-08-16T14:34:16.119763Z","submitted_at":"2023-12-15T21:30:49Z","title":"T-MAE: Temporal Masked Autoencoders for Point Cloud Representation Learning","version":3},"cited_work":{"arxiv_id":"2312.10217","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.10217","snapshot_observed_at":"2026-08-16T05:58:28.851450Z","title":"T-MAE: Temporal Masked Autoencoders for Point Cloud Representation Learning","venue":"cs.CV","work_id":"5badde50-e3e0-40f1-aee0-8960f63cb0ec","year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.326334Z"},"links":{"cited_paper":"/paper/2312.10217","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:72932dd5f5010065e05c80025607798905c1da1a13e22fbfb7d3d6e4539273e9","observation_id":"21d9f7da-6e7b-4e93-a61c-0013f03eac27","resolution":{"observed_at":"2026-08-16T05:58:28.857342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01403","last_updated":"2024-01-24T18:11:53Z","snapshot_observed_at":"2026-08-17T19:34:59.417167Z","submitted_at":"2023-10-02T17:58:52Z","title":"CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01403","snapshot_observed_at":"2026-08-16T05:58:28.375228Z","title":"Clipself: Vision trans- former distills itself for open-vocabulary dense prediction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.375228Z"},"links":{"cited_paper":"/paper/2310.01403","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:ba1fb12b38cb5435c13275648b72d749ca974e858228f584b187f24c3147d8a7","observation_id":"e646850d-569a-4142-ad03-301e36e20fab","resolution":{"observed_at":"2026-08-16T05:58:28.375228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:29.711973Z","title":"Masked scene contrast: A scalable framework for unsuper- vised 3d representation learning","venue":null,"work_id":"f36980f3-4993-451b-b50d-0789aaff9110","year":null},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.407106Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:20b497112e986d8c2fa0e167951296b5878285d32b2ba9ee8693966b5b2ff0f8","observation_id":"4d82e6fe-eefa-401f-bad3-276b0dcb4e4e","resolution":{"observed_at":"2026-08-16T05:58:29.715108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:29.700317Z","title":"Sed: A simple encoder-decoder for open-vocabulary semantic segmentation","venue":null,"work_id":"ab854480-3d25-4d09-a316-d84d2dc3b447","year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.410563Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:291696615a65d82cafe41e8b757025605c9b1e4d9659cad925f8b0e8fabe65be","observation_id":"048627c5-2f22-4c35-ab1e-10b4d916d323","resolution":{"observed_at":"2026-08-16T05:58:29.704158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:29.689930Z","title":"Pointcontrast: Unsupervised pre- training for 3d point cloud understanding","venue":null,"work_id":"62d266fc-8e8e-48b7-bc33-fd745b0932cb","year":2020},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.413712Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:29b8d433f08f0f1bc79021a9fa671a41b7b9e4b858a13e80f8a31c787fc67db0","observation_id":"414850d3-e67e-4afa-91be-4c5a5c20aa32","resolution":{"observed_at":"2026-08-16T05:58:29.693562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:29.540268Z","title":"Simmim: A simple framework for masked image modeling","venue":null,"work_id":"a9694d77-b277-4529-b5b0-9d5e5137c4af","year":2022},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.416866Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:4fd3565b2059423585f337d61d12a3407332324ee9be2f92d37c57ce9db45dac","observation_id":"65bcb96e-43bf-4878-a2bb-8704191bd398","resolution":{"observed_at":"2026-08-16T05:58:29.612618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17707","last_updated":"2025-02-04T11:40:44Z","snapshot_observed_at":"2026-08-16T14:39:14.160386Z","submitted_at":"2023-11-29T15:11:03Z","title":"SAMPro3D: Locating SAM Prompts in 3D for Zero-Shot Instance Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17707","snapshot_observed_at":"2026-08-16T05:58:28.420256Z","title":"Sampro3d: Locating sam prompts in 3d for zero-shot scene segmentation.arXiv preprint arXiv:2311.17707, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.420256Z"},"links":{"cited_paper":"/paper/2311.17707","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:174dd2fd2e649ad5d544fd96a9638e46563d8e85731af2a1341dbcc441c5c660","observation_id":"4b521be6-91bb-449e-b4e4-a1983d23d469","resolution":{"observed_at":"2026-08-16T05:58:28.420256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:29.479727Z","title":"Maskclus- tering: View consensus based mask graph clustering for open- vocabulary 3d instance segmentation","venue":null,"work_id":"01f0b5e5-54bc-4622-8a50-2c07fa5b9039","year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.423244Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:2d5930baae6e003605a21e48a0708d517b238060cc0406214706133f9cb42161","observation_id":"b2ef24f6-82f9-4f86-82eb-3d7139be65fd","resolution":{"observed_at":"2026-08-16T05:58:29.483251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06084","last_updated":"2024-07-08T16:26:52Z","snapshot_observed_at":"2026-08-16T13:36:05.788581Z","submitted_at":"2024-07-08T16:26:52Z","title":"3D Vision and Language Pretraining with Large-Scale Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06084","snapshot_observed_at":"2026-08-16T05:58:28.426729Z","title":"3d vision and language pretraining with large-scale synthetic data.arXiv preprint arXiv:2407.06084,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.426729Z"},"links":{"cited_paper":"/paper/2407.06084","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:4acd70a7e14d6ff5dd1a2c0852a551f57bdd4a97f9b056b8deae041f9c8945f8","observation_id":"51be96d3-3c84-41b3-a576-df7cf73126f6","resolution":{"observed_at":"2026-08-16T05:58:28.426729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:28.430295Z","title":"Gd-mae: gener- ative decoder for mae pre-training on lidar point clouds","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.430295Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:11c1e570c735ef0d7649ca401a3d7c2ad3b27f3001b6f59485bb02ed4e88815b","observation_id":"1db6b825-c282-48f1-ae6a-5f986b6b4a3a","resolution":{"observed_at":"2026-08-16T05:58:28.430295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05132","last_updated":"2025-03-20T23:06:14Z","snapshot_observed_at":"2026-08-16T19:30:31.655964Z","submitted_at":"2024-06-07T17:59:59Z","title":"3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less Hallucination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05132","snapshot_observed_at":"2026-08-16T05:58:28.433338Z","title":"3d-grand: A million-scale dataset for 3d-llms with better grounding and less hallucination.arXiv preprint arXiv:2406.05132, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.433338Z"},"links":{"cited_paper":"/paper/2406.05132","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:1a8153a3ae0feb82b5b3323b51f86a4d0f3566c1642045339f6ec484a9c4db15","observation_id":"c867954f-d97d-4a02-9867-858d4c34012e","resolution":{"observed_at":"2026-08-16T05:58:28.433338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:29.464000Z","title":"Regionplc: Regional point-language contrastive learning for open-world 3d scene understanding","venue":null,"work_id":"7bd638d7-9b39-4ddb-a9f1-55773d75eb76","year":null},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.436902Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:c9f87343d8dfea06261ae73318ef5f713905007477e2e3993120570fc53c4963","observation_id":"9d03856e-9818-46a7-a458-b49748010c4b","resolution":{"observed_at":"2026-08-16T05:58:29.467599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03908","last_updated":"2023-06-06T17:59:51Z","snapshot_observed_at":"2026-08-18T01:10:59.696873Z","submitted_at":"2023-06-06T17:59:51Z","title":"SAM3D: Segment Anything in 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03908","snapshot_observed_at":"2026-08-16T05:58:28.440274Z","title":"Sam3d: Segment anything in 3d scenes.arXiv preprint arXiv:2306.03908, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.440274Z"},"links":{"cited_paper":"/paper/2306.03908","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:9516fd9b4c6625884addd4e308e0c5e0b9084e3108f30eda22669f794f560f2f","observation_id":"ffeb84ee-446c-4192-84aa-2aba3d2f0704","resolution":{"observed_at":"2026-08-16T05:58:28.440274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:29.452811Z","title":"Metascenes: Towards automated replica creation for real-world 3d scans","venue":null,"work_id":"97c72f11-7cc7-4f65-b20d-6b619ce3135c","year":2025},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.443762Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:cc9bcc17ceb963e291849dab0ab985e06b039bcf46467fc9717a9cdcaa7c9eec","observation_id":"fc681d9b-ced2-466f-be6e-78865afb9a16","resolution":{"observed_at":"2026-08-16T05:58:29.457227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:29.442646Z","title":"Point-bert: Pre-training 3d point cloud transformers with masked point modeling","venue":null,"work_id":"ee9a60ae-198e-4343-8739-480cff2728d7","year":2022},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.447024Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:f0055f99552f456c8f3ee944c9a80646ae18b32ec6218135433c22753ada61b1","observation_id":"bd840b72-6f36-4b46-9177-058e9f49875b","resolution":{"observed_at":"2026-08-16T05:58:29.446462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:29.432351Z","title":"Clip2: Contrastive language-image- point pretraining from real-world point cloud data","venue":null,"work_id":"34f9fb62-9ab1-4551-8472-e6696255ac07","year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.450240Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:571e85fd30b0f05dfc75f1a62104360c01cf22e7a423be043e7ea1f915e9cae9","observation_id":"2f04313e-6117-4f6a-b617-739a653158ae","resolution":{"observed_at":"2026-08-16T05:58:29.436137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:29.422521Z","title":"Vision-language pre-training with object contrastive learning for 3d scene understanding","venue":null,"work_id":"ea050f19-6443-496b-a531-bb64650b4401","year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.453381Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:2cab4a9c233e030a90d418dac54df579fca1461b70d977b549a913fa22357ac5","observation_id":"b6b0a255-c531-48da-a783-950469e10e30","resolution":{"observed_at":"2026-08-16T05:58:29.425860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:29.411938Z","title":"Multi3drefer: Grounding text description to multiple 3d ob- jects","venue":null,"work_id":"512db215-81fd-493d-81cc-dba19306ff2d","year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.456692Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:a53e0239fb71a842419d4aa4e12484b83669ec47addb62727eb1d1e977218c25","observation_id":"47a460c8-59af-407b-955b-4b9d46f13f22","resolution":{"observed_at":"2026-08-16T05:58:29.415316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:29.312902Z","title":"Self-supervised pretraining of 3d features on any point-cloud","venue":null,"work_id":"cebaecda-de56-4923-82e6-eb35a49f014a","year":2021},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.459958Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:fb475e55d7faa6d81246518263280b3d4b923dc429da54d5313ddffda63155d1","observation_id":"67577ae0-edce-4ec2-9339-d407355d4165","resolution":{"observed_at":"2026-08-16T05:58:29.384716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-13T15:09:51.205767Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-16T05:58:28.463384Z","title":"3d-vla: A 3d vision-language-action generative world model.arXiv preprint arXiv:2403.09631, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.463384Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:db1663fced975cc0fe6394d965fa386ba719148573158b8a7734147952b68e92","observation_id":"159917a2-244a-47dc-afd8-8c86931c3136","resolution":{"observed_at":"2026-08-16T05:58:28.463384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:28.466561Z","title":"Structured3d: A large photo-realistic dataset for structured 3d modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.466561Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:6c13778b964f1047a825305b9c95b9471f277621dec78555f42bbc6b1f8a1e88","observation_id":"f8e42cae-a947-4fa0-ae2d-91ff5174f736","resolution":{"observed_at":"2026-08-16T05:58:28.466561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10220","last_updated":"2025-03-07T05:09:28Z","snapshot_observed_at":"2026-08-16T14:00:39.252550Z","submitted_at":"2024-04-16T02:01:56Z","title":"Closed-Loop Open-Vocabulary Mobile Manipulation with GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10220","snapshot_observed_at":"2026-08-16T05:58:28.469942Z","title":"Closed- loop open-vocabulary mobile manipulation with gpt-4v.arXiv preprint arXiv:2404.10220, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.469942Z"},"links":{"cited_paper":"/paper/2404.10220","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:e03da80d5c1c957e3b301bfccd1e52cee327d19a4ee205dd9a65bce67dde6fff","observation_id":"34df5384-c2b2-43e5-b637-b368bd378e4e","resolution":{"observed_at":"2026-08-16T05:58:28.469942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:29.178110Z","title":"Extract free dense labels from clip","venue":null,"work_id":"3a38c6b7-4be2-4fc9-8357-81960ce71fb2","year":null},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.472858Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:d76552470959a15ffbe657db4453122ffc071250b428d7b6ced9ff6ce26292f1","observation_id":"a19a8cf6-9e8b-4835-8b33-a52bee2c0729","resolution":{"observed_at":"2026-08-16T05:58:29.225113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06773","last_updated":"2023-10-10T16:49:21Z","snapshot_observed_at":"2026-08-16T14:53:22.965811Z","submitted_at":"2023-10-10T16:49:21Z","title":"Uni3D: Exploring Unified 3D Representation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06773","snapshot_observed_at":"2026-08-16T05:58:28.475958Z","title":"Uni3d: Exploring unified 3d representation at scale.arXiv preprint arXiv:2310.06773,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.475958Z"},"links":{"cited_paper":"/paper/2310.06773","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:39db86acbd4e057609bf1aafc5eb97433a658adcef2f92ebc0c35c57792f3317","observation_id":"b818cc9b-dc45-458b-a33f-35c5b4cfde2f","resolution":{"observed_at":"2026-08-16T05:58:28.475958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:29.079422Z","title":"Detecting twenty-thousand classes using image-level supervision","venue":null,"work_id":"01432a90-40c2-4821-9d6c-0ce26ee14dde","year":2022},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.502078Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:8436e2ad186ce0c9eb41ed6725509f4a254ad56dda80d4bd759e9c61f4d091c6","observation_id":"ad00c17a-0951-4836-86e7-8fd63036a62a","resolution":{"observed_at":"2026-08-16T05:58:29.124539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-08-16T13:15:01.097068Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-16T05:58:28.555565Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness.arXiv preprint arXiv:2409.18125, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.555565Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:45789eb1c2e94e3c4d7f66bd285e01116c0201139de1e9d65928239580fb3ada","observation_id":"b56dc2ec-4b53-482b-aa78-8b770496dfb8","resolution":{"observed_at":"2026-08-16T05:58:28.555565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:29.058589Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":"434630d8-36fd-43d0-b465-a0bc714a3fb8","year":2023},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.627676Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:ba8a536a3cdb77e904af8f016b6dde2ee3335bcfdf38f9d417e5490555305b09","observation_id":"9c3cb4cf-79a4-4f90-9499-8c9ddaafe77e","resolution":{"observed_at":"2026-08-16T05:58:29.062110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11442","last_updated":"2024-07-24T07:31:37Z","snapshot_observed_at":"2026-08-16T13:51:35.855032Z","submitted_at":"2024-05-19T04:35:05Z","title":"Unifying 3D Vision-Language Understanding via Promptable Queries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11442","snapshot_observed_at":"2026-08-16T05:58:28.684524Z","title":"Unifying 3d vision-language understanding via prompt- able queries.arXiv preprint arXiv:2405.11442, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.684524Z"},"links":{"cited_paper":"/paper/2405.11442","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:7fffb3ff62740517dacef566709ba8be4af56b18460261dd82d3758d0b448cf7","observation_id":"2c389b2c-4926-4c6a-a8a3-b04307b12597","resolution":{"observed_at":"2026-08-16T05:58:28.684524Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:58:30.873445Z","title":null,"venue":null,"work_id":"6966b34e-5f12-420f-91a5-ded6093e6a32","year":null},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:27.667351Z"},"links":{"citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:80d004b7ff55bb704bf94a67e4ef5b32e988e6d09fe00491be226550cf6644a2","observation_id":"de0e1657-967c-477f-8c07-6cb2d9b273b3","resolution":{"observed_at":"2026-08-16T05:58:30.953066Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding"},"reference_resolution":{"displayed":98,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":47,"verified_exact":1,"verified_fuzzy":48},"total_outbound_references":98},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 0 inbound Pith citation observations for arXiv:2504.19500."}