{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:FXEU2WQ4Z5KWYIA4OY2T2DEQAE","short_pith_number":"pith:FXEU2WQ4","schema_version":"1.0","canonical_sha256":"2dc94d5a1ccf556c201c76353d0c90013ca99f38d37291917c1cd49d42c11afb","source":{"kind":"arxiv","id":"2210.03105","version":2},"attestation_state":"computed","paper":{"title":"Mask3D: Mask Transformer for 3D Semantic Instance Segmentation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Alexander Hermans, Bastian Leibe, Francis Engelmann, Jonas Schult, Or Litany, Siyu Tang","submitted_at":"2022-10-06T17:55:09Z","abstract_excerpt":"Modern 3D semantic instance segmentation approaches predominantly rely on specialized voting mechanisms followed by carefully designed geometric clustering techniques. Building on the successes of recent Transformer-based methods for object detection and image segmentation, we propose the first Transformer-based approach for 3D semantic instance segmentation. We show that we can leverage generic Transformer building blocks to directly predict instance masks from 3D point clouds. In our model called Mask3D each object instance is represented as an instance query. Using Transformer decoders, the"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2210.03105","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2022-10-06T17:55:09Z","cross_cats_sorted":[],"title_canon_sha256":"a20a3d7584c0d6069fa548547834ce202e6480682ac905ea1b14232a526f279a","abstract_canon_sha256":"7564db9e47bc923eb7d2b03e658766647ce56dc3db1c778ba0fbf1a2ba07c9a6"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T06:00:13.605426Z","signature_b64":"mGeFGmniffe+G78rlqwJTq9mSdjiHSda18tHrwdCLRAYNdg7oh3rHST2KZTrM/c02KRQMviv6Kwp/3Oj745wAA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"2dc94d5a1ccf556c201c76353d0c90013ca99f38d37291917c1cd49d42c11afb","last_reissued_at":"2026-07-05T06:00:13.604886Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T06:00:13.604886Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Mask3D: Mask Transformer for 3D Semantic Instance Segmentation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Alexander Hermans, Bastian Leibe, Francis Engelmann, Jonas Schult, Or Litany, Siyu Tang","submitted_at":"2022-10-06T17:55:09Z","abstract_excerpt":"Modern 3D semantic instance segmentation approaches predominantly rely on specialized voting mechanisms followed by carefully designed geometric clustering techniques. Building on the successes of recent Transformer-based methods for object detection and image segmentation, we propose the first Transformer-based approach for 3D semantic instance segmentation. We show that we can leverage generic Transformer building blocks to directly predict instance masks from 3D point clouds. In our model called Mask3D each object instance is represented as an instance query. Using Transformer decoders, the"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2210.03105","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2210.03105/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2210.03105","created_at":"2026-07-05T06:00:13.604946+00:00"},{"alias_kind":"arxiv_version","alias_value":"2210.03105v2","created_at":"2026-07-05T06:00:13.604946+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2210.03105","created_at":"2026-07-05T06:00:13.604946+00:00"},{"alias_kind":"pith_short_12","alias_value":"FXEU2WQ4Z5KW","created_at":"2026-07-05T06:00:13.604946+00:00"},{"alias_kind":"pith_short_16","alias_value":"FXEU2WQ4Z5KWYIA4","created_at":"2026-07-05T06:00:13.604946+00:00"},{"alias_kind":"pith_short_8","alias_value":"FXEU2WQ4","created_at":"2026-07-05T06:00:13.604946+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":9,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.08925","citing_title":"ClickSeg3D: Few-Click Interactive Segmentation via Semantic Embeddings","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2511.16567","citing_title":"POMA-3D: The Point Map Way to 3D Scene Understanding","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2512.03532","citing_title":"OpenTrack3D: Towards Accurate and Generalizable Open-Vocabulary 3D Instance Segmentation","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2512.17817","citing_title":"Chorus: Multi-Teacher Pretraining for Holistic 3D Gaussian Scene Encoding","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2601.08831","citing_title":"3AM: 3egment Anything with Geometric Consistency in Videos","ref_index":65,"is_internal_anchor":false},{"citing_arxiv_id":"2602.23024","citing_title":"InCoM: Intent-Driven Perception and Structured Coordination for Mobile Manipulation","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08925","citing_title":"ClickSeg3D: Few-Click Interactive Segmentation via Semantic Embeddings","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2604.09167","citing_title":"MAG-3D: Multi-Agent Grounded Reasoning for 3D Understanding","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08916","citing_title":"MV3DIS: Multi-View Mask Matching via 3D Guides for Zero-Shot 3D Instance Segmentation","ref_index":46,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/FXEU2WQ4Z5KWYIA4OY2T2DEQAE","json":"https://pith.science/pith/FXEU2WQ4Z5KWYIA4OY2T2DEQAE.json","graph_json":"https://pith.science/api/pith-number/FXEU2WQ4Z5KWYIA4OY2T2DEQAE/graph.json","events_json":"https://pith.science/api/pith-number/FXEU2WQ4Z5KWYIA4OY2T2DEQAE/events.json","paper":"https://pith.science/paper/FXEU2WQ4"},"agent_actions":{"view_html":"https://pith.science/pith/FXEU2WQ4Z5KWYIA4OY2T2DEQAE","download_json":"https://pith.science/pith/FXEU2WQ4Z5KWYIA4OY2T2DEQAE.json","view_paper":"https://pith.science/paper/FXEU2WQ4","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2210.03105&json=true","fetch_graph":"https://pith.science/api/pith-number/FXEU2WQ4Z5KWYIA4OY2T2DEQAE/graph.json","fetch_events":"https://pith.science/api/pith-number/FXEU2WQ4Z5KWYIA4OY2T2DEQAE/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/FXEU2WQ4Z5KWYIA4OY2T2DEQAE/action/timestamp_anchor","attest_storage":"https://pith.science/pith/FXEU2WQ4Z5KWYIA4OY2T2DEQAE/action/storage_attestation","attest_author":"https://pith.science/pith/FXEU2WQ4Z5KWYIA4OY2T2DEQAE/action/author_attestation","sign_citation":"https://pith.science/pith/FXEU2WQ4Z5KWYIA4OY2T2DEQAE/action/citation_signature","submit_replication":"https://pith.science/pith/FXEU2WQ4Z5KWYIA4OY2T2DEQAE/action/replication_record"}},"created_at":"2026-07-05T06:00:13.604946+00:00","updated_at":"2026-07-05T06:00:13.604946+00:00"}