{"as_of":"2026-08-12T06:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:31a5ee59ae10e8a7b9208ab52c5f645a8ee361bb4a16f22fd6519c5533d6fa18","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T16:13:56.722386Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T18:06:09.895072Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-01T08:15:32.510741Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.14364","snapshot_observed_at":"2026-08-02T18:06:09.895072Z","title":"arXiv preprint arXiv:2512.14364 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.895072Z"},"links":{"cited_paper":"/paper/2512.14364","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:a559915f6c5deecb41a4d9abcc34636afb0cf7d9ab5d9ada65688dd3aabd32bd","observation_id":"7c711c68-0cd5-4ef3-98d1-cbe8c254770f","resolution":{"observed_at":"2026-08-02T18:06:09.895072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"cited_work":{"arxiv_id":"2512.14364","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.14364","snapshot_observed_at":"2026-07-01T08:15:32.510741Z","title":"Unified Semantic Transformer for 3D Scene Understanding","venue":"cs.CV","work_id":"d4f4fdbf-7432-4c71-9d3b-2974f7ec3f73","year":2025},"citing_paper":{"arxiv_id":"2605.25371","last_updated":"2026-06-09T02:13:19Z","snapshot_observed_at":"2026-08-03T14:37:55.134830Z","submitted_at":"2026-05-25T02:52:34Z","title":"FOUND-IT: Foundation-model-first Task-driven 3D Scene Graphs with Granularity on Demand","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T22:04:21.666471Z"},"links":{"cited_paper":"/paper/2512.14364","citing_paper":"/paper/2605.25371"},"observation_digest":"sha256:825d05b09bc40ecfe1d5209623e3b60cbf730e7cc344e19dcbafb4bb88e267a3","observation_id":"b666dc28-a108-471d-841b-1baa1d22533f","resolution":{"observed_at":"2026-06-29T22:14:00.415456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"cited_work":{"arxiv_id":"2512.14364","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.14364","snapshot_observed_at":"2026-07-01T08:15:32.510741Z","title":"Unified Semantic Transformer for 3D Scene Understanding","venue":"cs.CV","work_id":"d4f4fdbf-7432-4c71-9d3b-2974f7ec3f73","year":2025},"citing_paper":{"arxiv_id":"2606.14307","last_updated":"2026-06-30T10:03:58Z","snapshot_observed_at":"2026-07-31T03:54:17.412804Z","submitted_at":"2026-06-12T09:43:13Z","title":"Pano3D: Unified 3D Reconstruction and Panoptic Segmentation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T07:23:24.807344Z"},"links":{"cited_paper":"/paper/2512.14364","citing_paper":"/paper/2606.14307"},"observation_digest":"sha256:a72fbbbcd2d8168fbedb0e9563e13a693e743251d221def4cb439e8154672376","observation_id":"32359263-b489-48f0-97a4-b9925aff81e4","resolution":{"observed_at":"2026-07-01T08:15:32.512870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2512.14364/citation-record","integrity":"/paper/2512.14364/integrity","json":"/paper/2512.14364/citation-record.json","paper":"/paper/2512.14364"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02112","last_updated":"2025-06-04T02:28:08Z","snapshot_observed_at":"2026-08-09T22:15:39.414355Z","submitted_at":"2025-06-02T18:00:04Z","title":"SAB3R: Semantic-Augmented Backbone in 3D Reconstruction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02112","snapshot_observed_at":"2026-08-03T16:13:51.829966Z","title":"Sab3r: Semantic-augmented backbone in 3d reconstruction.arXiv preprint arXiv:2506.02112, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:51.829966Z"},"links":{"cited_paper":"/paper/2506.02112","citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:48fb7b7de384322f8b5f195de41c20dd9b813017a5992ec437f9ccf776af5e19","observation_id":"ef85ed60-9e7b-4dc6-8349-a9adae6951d7","resolution":{"observed_at":"2026-08-03T16:13:51.829966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:51.907699Z","title":"Schwing, Alexan- der Kirillov, and Rohit Girdhar","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:51.907699Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:eac25f2eb4ab43bd21929fa555de632b57e44f45bc36369b4eec54898e3ae8c2","observation_id":"6eb83102-cedd-477d-9a4f-a762c57bde73","resolution":{"observed_at":"2026-08-03T16:13:51.907699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:51.961952Z","title":"Scannet: Richly- annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:51.961952Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:87a206af184cab7d634ee602b20c20abbac8133428b2af2f2ebf91308c8979e6","observation_id":"424fab8b-906a-46c0-83ac-61f53a770ec8","resolution":{"observed_at":"2026-08-03T16:13:51.961952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:52.021178Z","title":"Scenefun3d: Fine-grained functionality and affordance un- derstanding in 3d scenes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:52.021178Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:14299ad2300c9039176035edd818f93b356b762d518c9cebeae791c3847128b3","observation_id":"9b4672a3-0cae-48a9-b65e-bd0960154908","resolution":{"observed_at":"2026-08-03T16:13:52.021178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:52.110622Z","title":"The llama 3 herd of models.arXiv e-prints, pages arXiv–2407,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:52.110622Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:576a26bf7a5d61a2aeadae0fdfaa55ae0e43608a43fe2542eb31fe9e24a75835","observation_id":"85ae6983-9706-4b92-8329-5ad9c02c53fd","resolution":{"observed_at":"2026-08-03T16:13:52.110622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:52.205158Z","title":"OpenNeRF: Open Set 3D Neural Scene Segmentation with Pixel-Wise Features and Rendered Novel Views","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:52.205158Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:f5356f3308caaf47084aa6fbe4f0a402864bc1265fe777136f8518979d460fc3","observation_id":"d5d2fec5-9bb1-41e4-9c7c-469fdf61d7a8","resolution":{"observed_at":"2026-08-03T16:13:52.205158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:52.265144Z","title":"A density-based algorithm for discovering clusters in large spatial databases with noise","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:52.265144Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:06c700af2463731d3bab69cab7d4422c7b3fb1e1a37c4e0e51c7fa8b64f4363d","observation_id":"96b3029e-afdb-4ccc-b64a-9b4cc0b90b8a","resolution":{"observed_at":"2026-08-03T16:13:52.265144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:52.322807Z","title":"Large spatial model: End-to-end un- posed images to semantic 3d.Advances in neural information processing systems, 37:40212–40229, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:52.322807Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:44255d304f5d4812f77dbeedac0e419d4eb9ea559c3c60f823f81260c5addfd5","observation_id":"edc85827-0bbf-43fb-b4ee-037302f166c3","resolution":{"observed_at":"2026-08-03T16:13:52.322807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:52.498620Z","title":"Efficient graph-based image segmentation.International journal of computer vision, 59(2):167–181, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:52.498620Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:5d9e55d1b0361b4256c3e28a16de0986e5e49ca1a0f47226b66f2c0feb1daee5","observation_id":"2d142051-adaf-4af1-97e8-7920c3b247ab","resolution":{"observed_at":"2026-08-03T16:13:52.498620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:52.657195Z","title":"Scal- ing open-vocabulary image segmentation with image-level labels","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:52.657195Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:133e90f319028a99ac726b1e44b9acbf4810d1d5d54aa5188b736f099290a8b4","observation_id":"58e58c7a-6cbe-4f62-8dd5-ed673b760b9b","resolution":{"observed_at":"2026-08-03T16:13:52.657195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:52.810249Z","title":"Ov3r: Open- vocabulary semantic 3d reconstruction from rgb videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:52.810249Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:242f3541393dfa341e5c8499d765419e09eebdcd17266681a589afe9c0049291","observation_id":"6ea98a13-d9d7-4c94-9d98-24889373891d","resolution":{"observed_at":"2026-08-03T16:13:52.810249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:52.993582Z","title":"Con- ceptgraphs: Open-vocabulary 3d scene graphs for perception and planning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:52.993582Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:dc64bc393e344ac1d5c78ef181a1ea8cbfe0226c03a4edc60b973a40ef6febb6","observation_id":"60af9cad-2ed4-48d1-912a-c2c7cda28f5d","resolution":{"observed_at":"2026-08-03T16:13:52.993582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:53.107545Z","title":"Occuseg: Occupancy-aware 3d instance segmentation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:53.107545Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:0c2edc73821a7e0f7dcadd5e053c116e23628308d30a9d5e8fdca44f5ebbb7b9","observation_id":"249f3950-ee5d-48a7-9ae5-850bfd836bbe","resolution":{"observed_at":"2026-08-03T16:13:53.107545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:53.228912Z","title":"Algorithm as 136: A k-means clustering algorithm.Journal of the royal statistical society","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:53.228912Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:358eaaad55247dd81d866253a89a9122071d3743e38b74289fda68665e12c911","observation_id":"288868a2-74dd-46dc-bf22-97e7a7ac4f5c","resolution":{"observed_at":"2026-08-03T16:13:53.228912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:53.339763Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:53.339763Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:7f81c8421b9ec552e83f92bd272bdc9299952dacedcc4220cc25e160c42fde73","observation_id":"a356fbf0-f95b-413d-b262-b427303e81c2","resolution":{"observed_at":"2026-08-03T16:13:53.339763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:53.457616Z","title":"Pe3r: Perception- efficient 3d reconstruction.arXiv preprint arXiv:2503.07507,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:53.457616Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:9576ca2e534cfc33c0813138b89fb4eff00442f8fbaa7de351ee7b25d5edf65c","observation_id":"f0ec8152-4ea5-410d-bdda-6cf1eb576747","resolution":{"observed_at":"2026-08-03T16:13:53.457616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:53.567985Z","title":"Tenenbaum, Celso Miguel de Melo, Madhava Krishna, Liam Paull, Florian Shkurti, and Antonio Torralba","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:53.567985Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:68f0528bf6df81645a96f2494d978287d78c5189f3dd04b934f20636364f37a0","observation_id":"2ee57efb-aabd-4240-81fd-bb0644917e7e","resolution":{"observed_at":"2026-08-03T16:13:53.567985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:53.662385Z","title":"Opd: Single-view 3d openable part detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:53.662385Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:20ed5ba121cf0e2737b4bd95163423ad27c22ce4f4d54d7974aeabd9d6f99e3a","observation_id":"0782c0c3-e47f-4c34-9eae-a22c7b8cb127","resolution":{"observed_at":"2026-08-03T16:13:53.662385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:53.754487Z","title":"Open-vocabulary 3d semantic segmentation with foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:53.754487Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:7eff0b071ced4eb8d176ec13ac209251298161ca05bdf549efd1b64c6d4db7c7","observation_id":"62c8885e-ee33-494e-94ac-d21d8360e5ae","resolution":{"observed_at":"2026-08-03T16:13:53.754487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.13414","last_updated":"2026-01-23T18:59:33Z","snapshot_observed_at":"2026-07-06T22:30:07.020487Z","submitted_at":"2025-09-16T18:00:14Z","title":"MapAnything: Universal Feed-Forward Metric 3D Reconstruction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.13414","snapshot_observed_at":"2026-08-03T16:13:53.815387Z","title":"MapAnything: Universal feed- forward metric 3D reconstruction.arXiv:2509.13414, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:53.815387Z"},"links":{"cited_paper":"/paper/2509.13414","citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:6cef0d44d8bf4d2409ecda4200edc60b4b75ad6910519ce52346097029e701e6","observation_id":"aa0d2542-7483-4769-824a-868473523534","resolution":{"observed_at":"2026-08-03T16:13:53.815387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:53.892781Z","title":"3d gaussian splatting for real-time radiance field rendering.ACM Transactions on Graphics, 42(4), 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:53.892781Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:8844a125fe7eaae61af644efe5aba9b0a31c2299d78c73baf5a02414ce703d44","observation_id":"c521f90f-e88a-4e3a-9826-2184c8f62dc7","resolution":{"observed_at":"2026-08-03T16:13:53.892781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:53.975692Z","title":"Lerf: Language embedded radiance fields","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:53.975692Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:7e12755e537ee503c24276d0bee5a5bc56bc6768f14fe1cacb94919e1e6be732","observation_id":"b4361fb3-6dce-4bfc-a07b-8b845fea12da","resolution":{"observed_at":"2026-08-03T16:13:53.975692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:54.064122Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:54.064122Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:3411086f85f1323d00bccf4f9e38e2674502bf1c82b952d9a511a156d87eb195","observation_id":"93f20ea8-530d-42d4-ba0d-07cc762a7c3b","resolution":{"observed_at":"2026-08-03T16:13:54.064122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:54.144779Z","title":"Open3dsg: Open-vocabulary 3d scene graphs from point clouds with queryable objects and open-set relationships","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:54.144779Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:e1802cada0da47b459014a8d0e4918c84d9386879e2153e7a9b5c08fc079392f","observation_id":"78a6cce2-eb0e-49ab-b0bb-4da3e40d7447","resolution":{"observed_at":"2026-08-03T16:13:54.144779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:54.208533Z","title":"Relationfield: Relate anything in radiance fields","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:54.208533Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:4fd6636294bca2f410942acc7fa5b4d0b1b8aa183735934d6b6273464ca93a52","observation_id":"4c5e345e-82c2-4402-9f60-8a1f3a829437","resolution":{"observed_at":"2026-08-03T16:13:54.208533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:54.285222Z","title":"Iggt: Instance- grounded geometry transformer for semantic 3d reconstruc- tion.arXiv preprint arXiv:2510.22706, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:54.285222Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:bad60ee18b6fef192bb481d27ed75d77937fba5868279b63153472cab405e19a","observation_id":"0a3f2329-a3a1-4b86-8a8c-11336779d843","resolution":{"observed_at":"2026-08-03T16:13:54.285222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:54.359880Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:54.359880Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:490a954d0e50e3c009500a829a2121909e2b1714b2450787cad5de044dea90f5","observation_id":"7a6e91a4-8f2e-4cfd-a5e0-c7cdb9cdd006","resolution":{"observed_at":"2026-08-03T16:13:54.359880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:54.466426Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:54.466426Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:cceccc70725bbf592f74819dbbc5cf02656e359464c7a95ed663e52f71657aa2","observation_id":"0a1e28ef-cf82-423a-bd77-957a254ad257","resolution":{"observed_at":"2026-08-03T16:13:54.466426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:54.577239Z","title":"World- mirror: Universal 3d world reconstruction with any-prior prompting.arXiv preprint arXiv:2510.10726, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:54.577239Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:bd0412bfc162cf69ceb8f380b21e4e46b2f44a7b7ca3bf483478c61dda65555f","observation_id":"7a7ffcf9-ad16-4c70-9dfe-b2981a46c459","resolution":{"observed_at":"2026-08-03T16:13:54.577239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:54.638086Z","title":"Multiscan: Scalable rgbd scanning for 3d environments with articulated objects.Advances in neural information processing systems, 35:9058–9071, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:54.638086Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:59fb9e96cd556799f4a3309757e195212aea360e03b3e7351bccc459dfd394de","observation_id":"55877cbf-2255-4365-8313-7e625c65e563","resolution":{"observed_at":"2026-08-03T16:13:54.638086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:54.681470Z","title":"Accelerated hierarchical density based clustering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:54.681470Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:e170f9cf5fe6ca7408f506d1d4597f06698b9dde0dc2161791d6a17c212a744b","observation_id":"a09c34d0-1163-4440-a4bd-d9078f4cde84","resolution":{"observed_at":"2026-08-03T16:13:54.681470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:54.761229Z","title":"Nerf: Representing scenes as neural radiance fields for view syn- thesis.Communications of the ACM, 65(1):99–106, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:54.761229Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:2b798b89fa1e02cf7b38b3769b185f5065617496bdc6eaec57baba82cba0b588","observation_id":"56c84c05-3f24-4e44-8750-b2eb225e0bbe","resolution":{"observed_at":"2026-08-03T16:13:54.761229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:54.839360Z","title":"An End-to- End Transformer Model for 3D Object Detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:54.839360Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:ebef7b843d6af1870be4aa6273e496b8287b53a6d2f55607ded93809b17725e7","observation_id":"97a1356d-de04-44b6-8ff0-3f374ad4223b","resolution":{"observed_at":"2026-08-03T16:13:54.839360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:54.920220Z","title":"Mix3d: Out-of-context data augmenta- tion for 3d scenes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:54.920220Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:939a69c26d9755064098e13bb94eaff30463fdb6596170155ad7ebcc6c5eec0c","observation_id":"d693942f-2975-4438-a8f4-4abe9a05a7fb","resolution":{"observed_at":"2026-08-03T16:13:54.920220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:54.999557Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:54.999557Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:6505888761cfd5c07652e1ae2f20ad7b153cb588aed08b50ba8935373161b452","observation_id":"1bed2d4d-5498-4940-b614-252e007e293a","resolution":{"observed_at":"2026-08-03T16:13:54.999557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:55.079614Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:55.079614Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:cb6478f91544c30f20bfbd9fcdbf9af78f1aae4bce2921a6db4346ab821df2dd","observation_id":"4f64203a-d069-43a6-8378-54e31d43e383","resolution":{"observed_at":"2026-08-03T16:13:55.079614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:55.130971Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:55.130971Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:4b49b2638af448453fa4e3178150a699a99a7d79f97a5d55cd592247582c3be8","observation_id":"b67eb9f8-c877-4118-ade2-d2b01bc38843","resolution":{"observed_at":"2026-08-03T16:13:55.130971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:55.190541Z","title":"Deep hough voting for 3d object detection in point clouds","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:55.190541Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:b7b28f8e8fad69a304f39325dd68e956401f10b080ffb8103a62e44c2d0a9bc3","observation_id":"34b4d3e1-eb9f-4bf8-afdd-75651c99e4bd","resolution":{"observed_at":"2026-08-03T16:13:55.190541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:55.253104Z","title":"Langsplat: 3d language gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:55.253104Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:86e2789d6370bac010297b015706f710663df1ebd0ea2cd44fb87842bf2d8026","observation_id":"1cc2bd24-f2bb-479e-911c-ba97cd9a7bb6","resolution":{"observed_at":"2026-08-03T16:13:55.253104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:55.321312Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:55.321312Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:5a91b642d76aa822357ae71e11ec62c920510f9a6d71f40c5ad07ea806ff07d3","observation_id":"587c3746-fd74-4de7-bee2-5ba5ef7c1ab3","resolution":{"observed_at":"2026-08-03T16:13:55.321312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:55.394637Z","title":"Vi- sion transformers for dense prediction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:55.394637Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:a762adc68ca05922576fd4ea18b7ddd8c2b0527d3d3f705095443b18bec012a7","observation_id":"6275c937-c084-4334-b9d7-6a09b5862f07","resolution":{"observed_at":"2026-08-03T16:13:55.394637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:55.463373Z","title":"Language- grounded indoor 3d semantic segmentation in the wild","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:55.463373Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:a23cbd659e5c04b305a6b763dc67bc5df9b64a0b06e06b442ac82f41a9173b7d","observation_id":"fb895f79-8e47-44a7-ade9-5bdbcd283d84","resolution":{"observed_at":"2026-08-03T16:13:55.463373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:55.546176Z","title":"Mask3D: Mask Trans- former for 3D Semantic Instance Segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:55.546176Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:0c443e4b4db7b6777c7106ec13b1810f73cd0a17352504712269af12432b4cde","observation_id":"6c767002-9f34-4d7a-8596-7e552b8ea99d","resolution":{"observed_at":"2026-08-03T16:13:55.546176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05797","last_updated":"2019-06-13T16:29:58Z","snapshot_observed_at":"2026-08-01T13:51:16.469557Z","submitted_at":"2019-06-13T16:29:58Z","title":"The Replica Dataset: A Digital Replica of Indoor Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05797","snapshot_observed_at":"2026-08-03T16:13:55.626779Z","title":"The replica dataset: A digital replica of indoor spaces.arXiv preprint arXiv:1906.05797,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:55.626779Z"},"links":{"cited_paper":"/paper/1906.05797","citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:8ef2b6eab410c06305992b4c540fa4a5c45a38ceba17f6b86c5f08ab69978da9","observation_id":"d57d49a6-0b0b-411f-aa6e-ee776e4793b4","resolution":{"observed_at":"2026-08-03T16:13:55.626779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:55.700796Z","title":"Uni3r: Unified 3d reconstruction and semantic understanding via generalizable gaussian splatting from unposed multi-view images, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:55.700796Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:2755a2483921d419643baabf940456ac02cd0cad05ced339c86de41ee3233281","observation_id":"1095a2ca-80b8-404d-9af7-d456b4adb6a7","resolution":{"observed_at":"2026-08-03T16:13:55.700796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:55.782117Z","title":"Sumner, Marc Pollefeys, Federico Tombari, and Francis Engelmann","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:55.782117Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:8b76c6ce1ff6452a35207a7889f5ca1127803a25aa8edac88fdb9ffea8371ee6","observation_id":"dfdce46d-b22f-46bc-955d-4a8d542bdf15","resolution":{"observed_at":"2026-08-03T16:13:55.782117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:55.847135Z","title":"Search3d: Hierarchical open-vocabulary 3d segmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:55.847135Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:20fe62350393e283f8551dff5f7b34e6e0ec52194d28a0475b79f4c9cf487fa4","observation_id":"31d3ce92-6e99-4236-87df-f871200d8923","resolution":{"observed_at":"2026-08-03T16:13:55.847135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:55.937835Z","title":"Softgroup for 3d instance segmentation on point clouds","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:55.937835Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:c1ed57ad24bc8d450fe8c2b7a057f86216f04680527c1269efbd1109f5eb236d","observation_id":"14fce24c-d453-41b8-94e8-9b7307ab980f","resolution":{"observed_at":"2026-08-03T16:13:55.937835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:56.010022Z","title":"Rio: 3d object instance re- localization in changing indoor environments","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:56.010022Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:7426226e5d4f0499120aff189f598c25d24c3d5b193a5570427d07bcb59c0873","observation_id":"ffe0354a-a5c4-4de8-a4df-bfd1c8b455ce","resolution":{"observed_at":"2026-08-03T16:13:56.010022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:56.092128Z","title":"Vggt: Visual geometry grounded transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:56.092128Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:a136804b67cbd08efc6754919cedf1c387a56b3a46fd551dfe93c766c0f9ab63","observation_id":"c5e2d57a-5077-4b3c-94f3-961e83d9f30d","resolution":{"observed_at":"2026-08-03T16:13:56.092128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:56.135198Z","title":"Dust3r: Geometric 3d vision made easy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:56.135198Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:92f4b1c826007624e265a86e5a8fa9fe71aa4f1e5707cbfa68bf2bd913be85c6","observation_id":"d9d3d5ec-61eb-4c2c-9ffb-37ee10a01787","resolution":{"observed_at":"2026-08-03T16:13:56.135198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:56.207555Z","title":"Shape2motion: Joint analysis of motion parts and attributes from 3d shapes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:56.207555Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:79e3920d4b63d53a0c57782e718d4a5ec9a80e9e0afb39c1f7ca1ef93c8cc498","observation_id":"cb635117-6fef-4a67-9386-2b41fface530","resolution":{"observed_at":"2026-08-03T16:13:56.207555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:56.284094Z","title":"π3: Scalable permutation-equivariant visual geometry learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:56.284094Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:f73a1abddd46eae49cf57189ecbaa3b4fa59df00e59b64536ec7b210fe68e53c","observation_id":"f5c3fdb6-b9ca-4cfd-8ce3-0cb30b2eb07d","resolution":{"observed_at":"2026-08-03T16:13:56.284094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:56.342595Z","title":"Hierarchical open- vocabulary 3d scene graphs for language-grounded robot nav- igation.Robotics: Science and Systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:56.342595Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:d01a9f99ec5cf72a68ceac83644f27a165ceb620234c18c848a84388f0805acc","observation_id":"e7369080-302c-469a-88cf-4b98bcfc31f6","resolution":{"observed_at":"2026-08-03T16:13:56.342595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:56.394164Z","title":"Point transformer v3: Simpler, faster, stronger","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:56.394164Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:d9ffbf66455839fb3dc67ec0c160d352c97810147833d9b36379fca253c627a3","observation_id":"2e5e07dd-7513-409c-b292-1195f0d89a6a","resolution":{"observed_at":"2026-08-03T16:13:56.394164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03908","last_updated":"2023-06-06T17:59:51Z","snapshot_observed_at":"2026-08-10T20:11:08.892177Z","submitted_at":"2023-06-06T17:59:51Z","title":"SAM3D: Segment Anything in 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03908","snapshot_observed_at":"2026-08-03T16:13:56.470579Z","title":"Sam3d: Segment anything in 3d scenes.arXiv preprint arXiv:2306.03908, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:56.470579Z"},"links":{"cited_paper":"/paper/2306.03908","citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:462be4b710f666c3bf91e7063b698dc8ebe8e822aae6db80362cf41bb72fc456","observation_id":"ca80aa73-bd3c-4702-b421-38b6fd74a210","resolution":{"observed_at":"2026-08-03T16:13:56.470579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:56.525303Z","title":"Scannet++: A high-fidelity dataset of 3d indoor scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:56.525303Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:7d998c1dec50f722bbdab088aeea09c22b74f4bf486353acd4bfd4405cd1d934","observation_id":"11fde6eb-4f65-4dc1-aed3-5c7ea40d2e3e","resolution":{"observed_at":"2026-08-03T16:13:56.525303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:56.587667Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:56.587667Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:94fd1a0cb0d2c01c34889659a85f8697749f5163bb5454285fc68a2f10044ae5","observation_id":"013acef2-1648-466c-89bc-e02dc179d507","resolution":{"observed_at":"2026-08-03T16:13:56.587667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:56.647218Z","title":"Clip-fo3d: Learning free open-world 3d scene representations from 2d dense clip","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:56.647218Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:1d40e1d6b3fc87b06839a94b0b3783ae93a981c244a589c242fcb3ccdba49b95","observation_id":"40cdb8e9-6ca5-4634-98c0-a27f110eb2f9","resolution":{"observed_at":"2026-08-03T16:13:56.647218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:13:56.722386Z","title":"Panst3r: Multi-view consistent panoptic segmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T16:13:56.722386Z"},"links":{"citing_paper":"/paper/2512.14364"},"observation_digest":"sha256:a91ab5548e1dc5aeb972af9ec1afead573daa75a3d2e886bab9c23681960cd96","observation_id":"630d8038-1d29-42fa-95ed-5c17b4e7a421","resolution":{"observed_at":"2026-08-03T16:13:56.722386Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 3 inbound Pith citation observations for arXiv:2512.14364."}