{"as_of":"2026-08-08T06:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e011feb546bbc44b041d3ccf5fb5a058899ec33e488e38ed50f531c52d860b24","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T18:23:33.405985Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:12:08.483436Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T23:12:09.275500Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"cited_work":{"arxiv_id":"2502.10392","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.10392","snapshot_observed_at":"2026-08-06T23:12:09.275500Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","venue":"cs.CV","work_id":"4b6e69df-4be3-4b5e-a0a4-e34c176a96cd","year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-08T04:14:25.873050Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.483436Z"},"links":{"cited_paper":"/paper/2502.10392","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:688fa2152918d139d30059d89b0f12ec8e28ffbd8f5c0db3cb5d92d52fe5dd7c","observation_id":"c570fe5d-f911-48a9-acee-dc952887e705","resolution":{"observed_at":"2026-08-06T23:12:09.345486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.10392/citation-record","integrity":"/paper/2502.10392/integrity","json":"/paper/2502.10392/citation-record.json","paper":"/paper/2502.10392"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.714941Z","title":"3dref- transformer: Fine-grained object identification in real-world scenes using natural language","venue":null,"work_id":"71bb29f3-4dfe-428a-99c9-430940687fbb","year":null},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.747819Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:fa31fb23cde76785e541c8975021c14500ddaa4f875440eed626cc33ec95cf8c","observation_id":"91cfb1c4-e0b4-452f-8894-5c85afe63f85","resolution":{"observed_at":"2026-08-07T18:23:34.720515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.700129Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":"fb074590-fd61-4eda-9238-67c99842e4fa","year":2020},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.789680Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:4c32e3c6414a29e880f57b39c6420c6ab1c2774557042790eeb02da327540aaf","observation_id":"fecf3803-be5e-42b0-a5eb-2615762778a0","resolution":{"observed_at":"2026-08-07T18:23:34.705296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.685275Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":"1425a3cd-96cf-4cc7-942f-71f3a0e7d802","year":2020},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.809061Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:970bf5b333b0e4845de4f605791910a04a7f1a159c96ca4521c3f1f943fa44e1","observation_id":"d5d26528-54d3-45ed-8574-9f2eb8fd6d49","resolution":{"observed_at":"2026-08-07T18:23:34.690136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.671383Z","title":"Hierarchical aggregation for 3d instance segmentation","venue":null,"work_id":"13de9962-49a1-45e3-89bc-f29b0f086204","year":2021},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.836708Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:c976ed0f386fc25d310520d5b9c9bd7986a0feee9eb85aec12ddc8b9811106da","observation_id":"b835c2ba-5b46-4922-a9ae-71070f72e9c8","resolution":{"observed_at":"2026-08-07T18:23:34.675854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.657002Z","title":"V oxelnext: Fully sparse voxelnet for 3d object detection and tracking","venue":null,"work_id":"c003ac78-9f43-4137-91d1-02be7ecdb1ba","year":2023},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.842046Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:db37490f8a33e12e16fd16fa72ec362696d6d39d50265acbce89525817c93cef","observation_id":"87e589f0-f55f-4d77-b9cf-b20fee2e5183","resolution":{"observed_at":"2026-08-07T18:23:34.661760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.642503Z","title":"4d spatio-temporal convnets: Minkowski convolutional neural networks","venue":null,"work_id":"a843e2db-33aa-4f4e-830d-a91c43770aba","year":2019},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.846693Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:b1d061dbba22fbef372b4547acb19ecdf629164862419e51841e1cb572f94a53","observation_id":"3a3dc8ce-6ac9-4348-9cad-f30833bac15b","resolution":{"observed_at":"2026-08-07T18:23:34.647451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.3555","last_updated":"2014-12-11T06:46:53Z","snapshot_observed_at":"2026-08-03T11:40:51.182181Z","submitted_at":"2014-12-11T06:46:53Z","title":"Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.3555","snapshot_observed_at":"2026-08-07T18:23:32.851743Z","title":"Empirical evaluation of gated recurrent neural networks on sequence modeling","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.851743Z"},"links":{"cited_paper":"/paper/1412.3555","citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:7b4dc4596822859aee110cc9d4c38c625e13714b931bd70708192edb7ee406fe","observation_id":"a30fadaa-411b-4254-8746-8c620557e8f2","resolution":{"observed_at":"2026-08-07T18:23:32.851743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.627050Z","title":"V oxel r-cnn: Towards high performance voxel-based 3d object detection","venue":null,"work_id":"1450620a-de59-4021-a798-41c4778be051","year":2021},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.856691Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:d59ec4283388ee07e28347f1ff5303e3ff6ff3b69cc352893295462c0e921768","observation_id":"3d1b2402-0fe3-4e10-a405-be0abbbadd81","resolution":{"observed_at":"2026-08-07T18:23:34.632597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T18:23:32.861307Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.861307Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:548645a146f0feb19b2e73750edff3cc690495c0220cf783c7c1d19c8abe8ab1","observation_id":"3a6ac482-4342-4dbb-9728-3d09b6dff10d","resolution":{"observed_at":"2026-08-07T18:23:32.861307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.612289Z","title":"Free-form description guided 3d visual graph net- work for object grounding in point cloud","venue":null,"work_id":"cff7b97f-7d2a-4e2a-9893-f5bfdadf1733","year":2021},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.866157Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:21e5b6194b2fe26d2bcffddb8e7fceec60b1ed9ca54f0e9f0459453b90e7dcaa","observation_id":"8943bf47-1048-447a-b0ca-65c963daacf4","resolution":{"observed_at":"2026-08-07T18:23:34.617018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.598564Z","title":"3d semantic segmentation with submanifold sparse convolutional networks","venue":null,"work_id":"ce6ffd38-9f51-4798-8854-4a15a494d94c","year":null},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.870931Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:a728e908300a24ada88b463a5a31c0d3a5ef6646a90bdceb3bd29165fa50c4d3","observation_id":"40987891-545f-4a69-8bfb-5f5a44caaea4","resolution":{"observed_at":"2026-08-07T18:23:34.602930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.583672Z","title":"Generative sparse detection networks for 3d single-shot ob- ject detection","venue":null,"work_id":"36545630-cb2d-4910-acaa-22de870a59f3","year":2020},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.875377Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:7c78b09a09d1451c5e8cc0d9eb2503fbb8767d8ee5a5bd65bd9b621137e68093","observation_id":"07f7a4c6-e019-4da0-934c-360f9a3287ea","resolution":{"observed_at":"2026-08-07T18:23:34.588182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.529896Z","title":"Transrefer3d: Entity-and- relation aware transformer for fine-grained 3d visual ground- ing","venue":null,"work_id":"b20fec7a-4442-4bd2-9794-b6693444197b","year":2021},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.879643Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:6f85b4a40a4a60f83b611c8276d0f71cf768ee2a4fe0473605481463925a1867","observation_id":"4ed98385-d0b2-4bad-9c5c-3b1856ef55d4","resolution":{"observed_at":"2026-08-07T18:23:34.556482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.419570Z","title":"Text-guided graph neural networks for refer- ring 3d instance segmentation","venue":null,"work_id":"3c4d85c8-0adf-41ff-8604-02ae48a1761d","year":null},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.883782Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:8e5df95619527ee14a43af8bc4d24f0103cb18c2b051888793dcffe6b758b92c","observation_id":"e1fd7ebc-1b40-4c81-a8ed-4cf9f5076fb1","resolution":{"observed_at":"2026-08-07T18:23:34.475010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.257564Z","title":"Multi- view transformer for 3d visual grounding","venue":null,"work_id":"18457cfd-9e3e-441c-9c0f-611baee37931","year":2022},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.888863Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:6a75a666a863d8329e6d92931f07a3760a07af53e5a6a9d4915bd287fc8ece3a","observation_id":"ba8ff485-3692-4724-841c-c2ec679ba492","resolution":{"observed_at":"2026-08-07T18:23:34.305284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.242383Z","title":"Bottom up top down detection transform- ers for language grounding in images and point clouds","venue":null,"work_id":"dabc9d7d-a443-49f0-89da-066f24e77640","year":2022},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.893482Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:066eae33af31d0b67cefca1137a9699e6f4959df39ba5d25730549884c87d962","observation_id":"7bbf39e2-d87c-4f2e-ac2f-6f8e820689f9","resolution":{"observed_at":"2026-08-07T18:23:34.247365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.228019Z","title":"Pointgroup: Dual-set point grouping for 3d instance segmentation","venue":null,"work_id":"21924c13-0a4c-4132-8b8a-8dd38487d459","year":null},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.897438Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:14af2c82d263575c884a7a407f218ee5dad8112454b690d55785f5fdbe888554","observation_id":"bf9192ef-7d7e-4823-ae2d-dba1bded9cdd","resolution":{"observed_at":"2026-08-07T18:23:34.232621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:32.901956Z","title":"Grounded language-image pre-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.901956Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:965ea5b2f2ac2057aca2a99b221137b92fba34f7087c164842bc15d519f2e1fd","observation_id":"ca0fae1e-5351-4e79-82c8-53a5e7bdbe42","resolution":{"observed_at":"2026-08-07T18:23:32.901956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05785","last_updated":"2024-07-22T03:21:27Z","snapshot_observed_at":"2026-08-05T03:56:22.669895Z","submitted_at":"2024-06-09T13:52:12Z","title":"A Survey on Text-guided 3D Visual Grounding: Elements, Recent Advances, and Future Directions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05785","snapshot_observed_at":"2026-08-07T18:23:32.905897Z","title":"A survey on text-guided 3d visual grounding: Elements, recent advances, and future directions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.905897Z"},"links":{"cited_paper":"/paper/2406.05785","citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:f88350a2a36ec5f7e32361a247db4d594ed8a747fab33f780436b3b36d7f1b8d","observation_id":"14005a35-d878-4e40-9e02-a01880618ecd","resolution":{"observed_at":"2026-08-07T18:23:32.905897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T18:23:32.910851Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.910851Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:3ac2549f4067cf4e7fee21c3f0e713c9bcf8122f99811fa9a2efe72775f237a2","observation_id":"0b4b74de-5a7b-4376-a383-f4d4e29a3a1d","resolution":{"observed_at":"2026-08-07T18:23:32.910851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.203395Z","title":"Group-free 3d object detection via transformers","venue":null,"work_id":"8ef58fad-53af-4840-a509-ae5f32c29c00","year":2021},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.915421Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:ee2bccb5420734a133bef96be747342e44316b281d139a45148d500631e54040","observation_id":"b08c95ed-f0a1-4541-b7c9-9fd462e872e5","resolution":{"observed_at":"2026-08-07T18:23:34.208721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.188315Z","title":"3d-sps: Single-stage 3d visual grounding via referred point progressive selection","venue":null,"work_id":"2e36cc40-25d5-4df6-8737-4bbe202f21b1","year":2022},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.919964Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:82aef124c6d432b0af9793fb3d80bf4c45f88ca4927c45b2ebf0b8a23a9918a5","observation_id":"7dd05c72-1ad1-44e2-8929-b8db88e9d117","resolution":{"observed_at":"2026-08-07T18:23:34.193643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:32.925043Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.925043Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:4c94af262deb5a1808380c7f00f699c3a4494956b8fba571916de6695154d5da","observation_id":"9c21773d-068e-47ce-802c-0bd83837e4ba","resolution":{"observed_at":"2026-08-07T18:23:32.925043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.163458Z","title":"Glove: Global vectors for word representation","venue":null,"work_id":"3a0f2ddc-7b28-4ecc-b165-7994b02c8af7","year":2014},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.928961Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:acb1a65744176254794587cd79900a23bd35e143b82e7f27a0850ffbbf0b2b70","observation_id":"2e18928e-88dc-4c37-9ecd-5283664e6b2a","resolution":{"observed_at":"2026-08-07T18:23:34.167920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.147983Z","title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space","venue":null,"work_id":"134fa0a5-361c-4818-ab68-79d6791f95bf","year":2017},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.933885Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:ff89d9980b87324ab401f324e061aaab824fddb25285038a4acf5e92950fd511","observation_id":"14c71be1-2c80-434d-8616-8e774e7e0d64","resolution":{"observed_at":"2026-08-07T18:23:34.153531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.134232Z","title":"Deep hough voting for 3d object detection in point clouds","venue":null,"work_id":"e8c880a1-dd5c-4c85-bca1-4d80ee1aa373","year":2019},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.938340Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:1e07a605d9141a7b65b6ba6ab0923e42dd81e2cd0b4e6ecd929d958c20433cc0","observation_id":"267cbbb9-beda-42e0-a275-7dcf40bac67b","resolution":{"observed_at":"2026-08-07T18:23:34.138842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.119876Z","title":"Multi-branch collaborative learning network for 3d visual grounding","venue":null,"work_id":"45c4afd7-0890-4621-8f47-35b6964ce092","year":2025},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.942894Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:873c8b9ebfcf411f96223921aebaa7f4b746b8aa8cd2dddbdbe7e13103f79a76","observation_id":"90fe068a-0ac8-4200-a34a-9d9e24148d13","resolution":{"observed_at":"2026-08-07T18:23:34.124735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.106101Z","title":"Languagerefer: Spatial-language model for 3d visual grounding","venue":null,"work_id":"d96efd54-92b7-4b0f-a5cf-2c398bdf25da","year":2022},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.948240Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:c212821bdebb7a96364dd3981bb46ef8f96997d89ecc269616bb11ce7c03fab6","observation_id":"b037f560-81bc-4087-8b33-03d91a271bdb","resolution":{"observed_at":"2026-08-07T18:23:34.110390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:34.091473Z","title":"Fcaf3d: Fully convolutional anchor-free 3d object detection","venue":null,"work_id":"6314a6b0-3716-407e-97c9-131b9f0c7b95","year":2022},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.952553Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:b483ac916d04752971bfd57a8160c172ec9c256b67c331ebef362dd73bc7a1da","observation_id":"d922a978-050c-4ede-94a6-4d88973adc19","resolution":{"observed_at":"2026-08-07T18:23:34.096544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:33.973606Z","title":"Tr3d: Towards real-time indoor 3d object detection","venue":null,"work_id":"8f164c6b-658d-4f84-a087-6a6eead93936","year":2023},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.956672Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:0e9581fe4e414cfbc134c30d4848a97d1975ef0f3bc7118cabe216b640a1dea1","observation_id":"945d7bb3-a89d-4087-8676-3b2d2ee5b772","resolution":{"observed_at":"2026-08-07T18:23:34.033545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:33.844978Z","title":"Viewpoint- aware visual grounding in 3d scenes","venue":null,"work_id":"fdec6307-30f3-4768-ab28-ecdfd301e5e1","year":2024},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:32.961214Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:a9c891be566800a9dbd75e2f18a76482448d2fa2f2e71f97f78d6e1ad7399733","observation_id":"0032efb0-51a6-4d00-88fe-97a4fab7b28f","resolution":{"observed_at":"2026-08-07T18:23:33.906228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:33.738452Z","title":"Softgroup for 3d instance segmentation on point clouds","venue":null,"work_id":"d796d37c-9ba0-45cd-a6e0-7f47bde7409c","year":2022},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:33.001581Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:912f307de2f5749aff75c885588a507cef1c615e2b054fbd63cf10b4a8f0147d","observation_id":"01369dff-933a-4a1f-b49b-b2727a4e44d7","resolution":{"observed_at":"2026-08-07T18:23:33.782494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:33.723463Z","title":"Ca- group3d: Class-aware grouping for 3d object detection on point clouds","venue":null,"work_id":"c49ed988-8149-4141-b4d6-1677bf185063","year":2022},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:33.054511Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:9c540065b71c2ad8481c6e941a84d8b7a550e162c4eb4398f1f7cafe4918732e","observation_id":"95ef3733-6a38-4f83-a85d-ace94208743d","resolution":{"observed_at":"2026-08-07T18:23:33.728639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:33.707545Z","title":"Gˆ 3-lq: Marrying hyperbolic alignment with explicit semantic-geometric mod- eling for 3d visual grounding","venue":null,"work_id":"338a2310-0481-495b-8437-6f15420e300b","year":null},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:33.078298Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:ebb87ce6f70b682ad81a349e82d0044bc2cf86783bcc7861e2464cfcb99b46cb","observation_id":"8c2e38c6-b7d7-48b3-9b6f-11c788b0fcf9","resolution":{"observed_at":"2026-08-07T18:23:33.713266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:33.692754Z","title":"Eda: Explicit text-decoupling and dense alignment for 3d visual grounding","venue":null,"work_id":"a8099bdb-2dc2-4188-b08f-0fb96e3b9d04","year":2023},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:33.132785Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:44cdaa6aa0c187bc450a4b8c54ae3ef665c5591bfb656b70ca557986bcd5e1f2","observation_id":"019501b6-79bf-4eab-a522-1afe4370b9db","resolution":{"observed_at":"2026-08-07T18:23:33.697644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:33.676381Z","title":"Binariz- ing sparse convolutional networks for efficient point cloud analysis","venue":null,"work_id":"199b32e8-3180-415f-8401-04687c82cb51","year":2023},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:33.180774Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:3e933252e4e25125539df575a37d2bbb0b39926c119560e5fb2a0a570126f889","observation_id":"55a9e7ca-b69b-4d17-9e3a-112be7828454","resolution":{"observed_at":"2026-08-07T18:23:33.681985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:33.660025Z","title":"3d small object detection with dynamic spatial pruning","venue":null,"work_id":"53c509ed-c24b-40ed-9783-8d75d1170c0b","year":2024},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:33.230320Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:c2da3a7f3cad8165839c4f7ddc58637c925b504a703143c06dd946ca399111eb","observation_id":"a31cb90a-4147-4613-b80b-0915f7e09d05","resolution":{"observed_at":"2026-08-07T18:23:33.665185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:33.645208Z","title":"Sat: 2d semantics assisted training for 3d visual grounding","venue":null,"work_id":"924e51a8-bbc0-49d9-ab07-fc56103d754f","year":2021},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:33.263494Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:ac3dd2b59942ddda8e2312018eaf8d7606024399ca8c116a81f1ee33367cc08e","observation_id":"6a778b5a-95ed-4307-b6e1-47e6d03367b5","resolution":{"observed_at":"2026-08-07T18:23:33.649827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:33.627751Z","title":"Instancerefer: Cooperative holistic understanding for visual grounding on point clouds through instance multi-level contextual refer- ring","venue":null,"work_id":"8add5abd-f189-49e3-9cd1-3b82e0fad816","year":2021},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:33.326313Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:20504244705d09f5f6cb21ea4ed366bb1da8f361dd32109174e302734b7adc34","observation_id":"f526e945-6a66-40a5-9147-5e8aa14903a0","resolution":{"observed_at":"2026-08-07T18:23:33.632786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:33.610952Z","title":"3dvg- transformer: Relation modeling for visual grounding on point clouds","venue":null,"work_id":"6885244b-0646-41ab-a9d9-bb467b7e7395","year":2021},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:33.383798Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:f96cff9f7d025769dae1b7599d985a3ac8bf38e0af42b8769bd0778ca2b99930","observation_id":"cb2fdf9a-f6fc-43d3-a4d9-87f974d89e27","resolution":{"observed_at":"2026-08-07T18:23:33.616925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:23:33.593089Z","title":"multi-object","venue":null,"work_id":"6aa9b77f-ca1b-4e0a-a6e7-70265ec4c158","year":2023},"citing_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:33.405985Z"},"links":{"citing_paper":"/paper/2502.10392"},"observation_digest":"sha256:d3786fbce94b8313315d6d8b0736081b7e01882b974c7120e1bbce1d19902264","observation_id":"0754fa42-ccf3-4d99-80e9-5c2378ab07e2","resolution":{"observed_at":"2026-08-07T18:23:33.599029Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T18:16:55.375651Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2502.10392."}