{"as_of":"2026-08-07T10:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f86a85619bc3bca2a49bf5bc48369fd701070a2f48de26ec658c4b44032ec8e6","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:37:21.425460Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-15T13:51:30.008232Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T00:37:29.656433Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"cited_work":{"arxiv_id":"2507.07781","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07781","snapshot_observed_at":"2026-07-03T00:37:29.656433Z","title":"Surprise3d: A dataset for spatial under- standing and reasoning in complex 3d scenes","venue":null,"work_id":"4f8fa950-aac2-4ade-aab2-b371a451b874","year":2025},"citing_paper":{"arxiv_id":"2512.06774","last_updated":"2026-04-09T06:38:35Z","snapshot_observed_at":"2026-07-06T22:37:59.340166Z","submitted_at":"2025-12-07T10:26:35Z","title":"RDSplat: Robust Watermarking for 3D Gaussian Splatting Against 2D and 3D Diffusion Editing","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T00:33:29.282349Z"},"links":{"cited_paper":"/paper/2507.07781","citing_paper":"/paper/2512.06774"},"observation_digest":"sha256:12cd4c7bf97f8a4f867e8acc360200cb82601c24a08ad2b37827022b3498bf88","observation_id":"6a07e2e5-fa18-4df6-a88c-1e53ebdf9428","resolution":{"observed_at":"2026-05-17T00:33:44.661273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07781","snapshot_observed_at":"2026-07-15T13:51:30.008232Z","title":"arXiv preprint arXiv:2507.07781 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06445","last_updated":"2026-07-08T07:22:50Z","snapshot_observed_at":"2026-08-06T19:04:15.122942Z","submitted_at":"2026-03-06T16:37:15Z","title":"What if? Emulative Simulation with World Models for Situated Reasoning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-15T13:51:30.008232Z"},"links":{"cited_paper":"/paper/2507.07781","citing_paper":"/paper/2603.06445"},"observation_digest":"sha256:3157d13478525493e7b89adee1d18b17e08293c7a56ef1a47db4c3552f7c3541","observation_id":"f83cbea5-9f4e-44d1-bdd0-89ab94a8b873","resolution":{"observed_at":"2026-07-15T13:51:30.008232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"cited_work":{"arxiv_id":"2507.07781","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07781","snapshot_observed_at":"2026-07-03T00:37:29.656433Z","title":"Surprise3d: A dataset for spatial under- standing and reasoning in complex 3d scenes","venue":null,"work_id":"4f8fa950-aac2-4ade-aab2-b371a451b874","year":2025},"citing_paper":{"arxiv_id":"2606.08952","last_updated":"2026-06-08T02:55:05Z","snapshot_observed_at":"2026-08-06T12:33:17.178294Z","submitted_at":"2026-06-08T02:55:05Z","title":"AlloSpatial: Agentic Harness Framework for Spatial Reasoning in Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T17:08:22.609095Z"},"links":{"cited_paper":"/paper/2507.07781","citing_paper":"/paper/2606.08952"},"observation_digest":"sha256:d40a22696d659476ec2f2e32797890608bc0038094d9ffaa6ba1e864600a61b8","observation_id":"bba1b6d4-3609-4ea9-a515-fc025b6adf68","resolution":{"observed_at":"2026-07-03T00:37:29.657958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07781","snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2507.07781 (2025) 5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-08-07T08:14:32.907015Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"cited_paper":"/paper/2507.07781","citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:3a680f1efaeba4680c9169b5bdda1c4a17605a42b24faa1c2062340ddc59b403","observation_id":"e147e5dc-eb09-4b09-b902-16ed734977d4","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07781","snapshot_observed_at":"2026-07-11T23:56:52.009530Z","title":"Surprise3d: A dataset for spatial understanding and reasoning in complex 3d scenes.arXiv preprint arXiv:2507.07781,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","snapshot_observed_at":"2026-08-02T22:05:21.368164Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T23:56:52.009530Z"},"links":{"cited_paper":"/paper/2507.07781","citing_paper":"/paper/2607.03789"},"observation_digest":"sha256:1dedd6c6caa516eaafa0dd2ac8d9c0605a767bf954474d000b425ddf02538e49","observation_id":"01684f2e-885d-4528-b5d0-182573a6ee2e","resolution":{"observed_at":"2026-07-11T23:56:52.009530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07781/citation-record","integrity":"/paper/2507.07781/integrity","json":"/paper/2507.07781/citation-record.json","paper":"/paper/2507.07781"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:26.595031Z","title":"Scanents3d: Exploiting phrase-to-3d-object correspondences for improved visio-linguistic models in 3d scenes.WACV, 2022","venue":null,"work_id":"950d23d4-2c6a-4a37-8e11-5d8220f9d6b0","year":2022},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.114837Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:189c8a855fb1f47f075029508f347e58e156b22c732f31e55ea9d3d78a59d96e","observation_id":"9376cfc3-aed9-4cf8-83f9-69393bdf2cb9","resolution":{"observed_at":"2026-08-06T18:37:26.624177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:26.450946Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":"08edd833-808b-48b1-b025-e2d43c5d4cad","year":2020},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.120880Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:a6ffb845b560f6fd114dc168be399f34b5599d6f4ebfcb7a62ddbaf52cbe8a63","observation_id":"d8b9af87-1faa-4dd8-b234-3bcb510b0aef","resolution":{"observed_at":"2026-08-06T18:37:26.491641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:21.126873Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.126873Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:a7e2d0c2e77c0f9e516a4d70347a0c44bca23c65e4440756158d2b2cd223251b","observation_id":"1b40e861-a928-4ed0-997f-f53026a46edb","resolution":{"observed_at":"2026-08-06T18:37:21.126873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15558","snapshot_observed_at":"2026-08-06T18:37:21.133258Z","title":"Cosmos-reason1: From physical common sense to embodied reasoning.arXiv preprint arXiv:2503.15558, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.133258Z"},"links":{"cited_paper":"/paper/2503.15558","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:6f5a710c59cd6364cbd019d3f5efdf08557bf7d0b0e8610747bc434d305b51a7","observation_id":"b7e840de-bc4e-4b8c-901a-a6f8dc94ff4b","resolution":{"observed_at":"2026-08-06T18:37:21.133258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:26.268019Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":"4571e130-9c5e-4223-bbe9-b44df5d2fc34","year":2020},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.139122Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:27b77b0ccb32ebaf84aa63aef42aaa90c76bd91859bc08195c0fb672d5f784ff","observation_id":"543dca29-9e36-4ef3-9fa9-ac2c3d0652e9","resolution":{"observed_at":"2026-08-06T18:37:26.323272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:26.104277Z","title":null,"venue":null,"work_id":"0983dae8-d498-4252-a1da-5ab9bcb9d9bf","year":2020},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.145147Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:ff8dd971c16c92cee7c5f29fc64bb5d56a77de32603deaa9ffcec760c9cf746d","observation_id":"7aa50b6c-d6c4-4909-84da-bdd7a04867a1","resolution":{"observed_at":"2026-08-06T18:37:26.181776Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:25.951617Z","title":"Towards label-free scene understanding by vision foundation models","venue":null,"work_id":"9624b03c-9e0f-4bcf-a024-8e24ca745613","year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.151006Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:79ae8fef7eba9261eac8e577278ff0eb9e8241d74671942da529b455ac7938e5","observation_id":"a49de642-bb8a-4a85-ab87-769d11004151","resolution":{"observed_at":"2026-08-06T18:37:26.042482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:25.862126Z","title":"Clip2scene: Towards label-efficient 3d scene understanding by clip","venue":null,"work_id":"2c70bd8d-1b0c-4196-85ca-48097743fb66","year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.156005Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:ebc8765ffb96edb91140bd792d4d3f885bffefab21409b4aff6fbe711193ccc4","observation_id":"bf533800-795b-499b-937b-7d9eb46bb329","resolution":{"observed_at":"2026-08-06T18:37:25.903944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00326","last_updated":"2024-12-31T07:55:35Z","snapshot_observed_at":"2026-07-06T20:15:03.658292Z","submitted_at":"2024-12-31T07:55:35Z","title":"OVGaussian: Generalizable 3D Gaussian Segmentation with Open Vocabularies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00326","snapshot_observed_at":"2026-08-06T18:37:21.160848Z","title":"Ovgaussian: Generalizable 3d gaussian segmentation with open vocabularies.arXiv preprint arXiv:2501.00326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.160848Z"},"links":{"cited_paper":"/paper/2501.00326","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:ed78bfb6cc4975a003e23e036bb83177906fadda16e2a874d8f4ce1e22506845","observation_id":"4148b6cc-5b0e-4a17-aed6-75c5f3173d47","resolution":{"observed_at":"2026-08-06T18:37:21.160848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09923","last_updated":"2023-09-29T04:03:28Z","snapshot_observed_at":"2026-08-02T01:36:10.819156Z","submitted_at":"2022-10-18T15:06:54Z","title":"Zero-shot point cloud segmentation by transferring geometric primitives","version":3},"cited_work":{"arxiv_id":"2210.09923","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.09923","snapshot_observed_at":"2026-08-06T18:37:22.279454Z","title":"Zero-shot point cloud segmentation by transferring geometric primitives","venue":"cs.CV","work_id":"4c29163e-e183-47c0-b216-2917fcee8837","year":2022},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.166231Z"},"links":{"cited_paper":"/paper/2210.09923","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:c4196abe82b81cc77632d070dd0a3bb8c556d9512003409cad65e0d48c1fbfc1","observation_id":"c6b1ba35-5ff8-42c0-bb3c-8e907b4ee5c9","resolution":{"observed_at":"2026-08-06T18:37:22.363226Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:25.730206Z","title":"Bridging language and geometric primitives for zero-shot point cloud segmentation","venue":null,"work_id":"05fd29cc-94ed-4144-9c71-a1dff4a6a8f4","year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.171663Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:2a83e1f9160736480de45f3823ec971a714b145e074e39f2fc2ba09440c93278","observation_id":"241bf559-752a-4323-ac7b-128ab4e7f507","resolution":{"observed_at":"2026-08-06T18:37:25.784832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:25.620397Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning","venue":null,"work_id":"e5916786-f4cf-4406-ba90-14a571f11981","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.176775Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:4f508d36f73f8f709324efa794147850bf9d5dc07c06fee993f40a937c148633","observation_id":"b452f0b8-dea8-4990-ad3f-496a7d70925b","resolution":{"observed_at":"2026-08-06T18:37:25.684857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19326","last_updated":"2024-05-29T17:56:07Z","snapshot_observed_at":"2026-07-06T18:22:10.094519Z","submitted_at":"2024-05-29T17:56:07Z","title":"Reasoning3D -- Grounding and Reasoning in 3D: Fine-Grained Zero-Shot Open-Vocabulary 3D Reasoning Part Segmentation via Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19326","snapshot_observed_at":"2026-08-06T18:37:21.181823Z","title":"Reasoning3d–grounding and reasoning in 3d: Fine-grained zero-shot open-vocabulary 3d reasoning part segmentation via large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.181823Z"},"links":{"cited_paper":"/paper/2405.19326","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:4dfab700137a86d72be7dd607e9c3dc2835fb7afdc27031c9c3eacfc993cfe62","observation_id":"b292152c-adad-48cc-b2e8-98a6979bbdb0","resolution":{"observed_at":"2026-08-06T18:37:21.181823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-05T04:37:45.202508Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-06T18:37:21.187570Z","title":"Grounded 3d-llm with referent tokens.arXiv preprint arXiv: 2405.10370, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.187570Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:b3de864468a64bf92643c2eed95f48777ad8ec316ae90297f0481b4a491b0e79","observation_id":"93c3ecf0-d3c8-466b-af6a-67e62075dabd","resolution":{"observed_at":"2026-08-06T18:37:21.187570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:25.498152Z","title":null,"venue":null,"work_id":"ab1695fc-5419-41e5-b2c8-88240ad1b32c","year":2022},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.193512Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:f149cea36978ba3b96160c59fd6f47fc9d5fbb2191afed219eae18c70fc75490","observation_id":"3d085221-29a1-4e6c-a68a-63ec232906cd","resolution":{"observed_at":"2026-08-06T18:37:25.545431Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:25.278276Z","title":"Segpoint: Segment any point cloud via large language model","venue":null,"work_id":"6c4cdd81-4530-4cb7-9a79-23ab18d85ef9","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.199440Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:f1fafe9947dcfc947d8e76cd42483cb8b95c987b415cf6c9ccf05f42f72f355b","observation_id":"b5a4291c-4900-4b9b-9bad-50c7e71bef18","resolution":{"observed_at":"2026-08-06T18:37:25.369542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:25.174914Z","title":"3d concept learning and reasoning from multi-view images","venue":null,"work_id":"b6e397f6-6f8c-4e4a-8341-18af7d228d41","year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.205237Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:5db92fd95a3ab6853b3aea39990693da14ebe50bcffa74b83edd00bc18a6bf9a","observation_id":"1c0ae59c-f287-4a9d-b403-2c10bf660c0b","resolution":{"observed_at":"2026-08-06T18:37:25.223082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:25.035409Z","title":"3d-llm: injecting the 3d world into large language models","venue":null,"work_id":"e49d406d-6618-417f-8c23-6ddf4254f850","year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.211899Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:377d809af46560cdd8d0efc08af2b8dbd37b911378d1f5e21b3d1b5656cda834","observation_id":"88a24fde-1d8c-443a-8169-e0f0c819eac2","resolution":{"observed_at":"2026-08-06T18:37:25.076517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:24.879065Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":"cd266851-4567-4b01-9716-a5fb0b4f3172","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.217983Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:404d8041c0cdd7d6fa9e06ecea91686d4931065070f5e55286a5db2da42c7436","observation_id":"38fc496f-7a4c-4614-af2a-f2a6eef7d609","resolution":{"observed_at":"2026-08-06T18:37:24.930825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:24.725751Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":"12351df4-0f01-4513-a406-8f1924e6b2ff","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.224453Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:a03405999375aab17c8bfd78289ad083e43842a3ee8a735044a7a91c16c0374a","observation_id":"f7ee941a-0953-47fe-822d-78787c2cc680","resolution":{"observed_at":"2026-08-06T18:37:24.808362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:21.231214Z","title":"Mllm-for3d: Adapting multimodal large language model for 3d reasoning segmentation.arXiv preprint arXiv:2503.18135, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.231214Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:62f9940db7cad1e5ec3fc494584d1f1796b29f2d53fe5e51549890e02c478f9c","observation_id":"66773a7b-6149-40a1-9c5a-b97c8fc6ddeb","resolution":{"observed_at":"2026-08-06T18:37:21.231214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:24.607556Z","title":"Mllm-for3d: Adapting multimodal large language model for 3d reasoning segmentation, 2025","venue":null,"work_id":"b98b8107-4240-4380-9536-a4699e2d4c0d","year":2025},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.237038Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:c61e8fcd3b37741af309ea8d4fca71b3a3ecfaeabb84120eb4aeaddb472f549e","observation_id":"7600b532-ee8d-4d1b-8f5d-8ae1bade0159","resolution":{"observed_at":"2026-08-06T18:37:24.674946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17427","last_updated":"2025-02-09T07:32:21Z","snapshot_observed_at":"2026-07-06T18:20:44.070255Z","submitted_at":"2024-05-27T17:59:41Z","title":"Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.17427","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.17427","snapshot_observed_at":"2026-08-06T18:37:21.949316Z","title":"Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model","venue":"cs.CV","work_id":"a736f669-d2a0-4c16-a856-6c1ee7249e57","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.243530Z"},"links":{"cited_paper":"/paper/2405.17427","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:397b9137be6484b1c185947cab25ac12e3ab32ab476d936522087ba4bc9942a0","observation_id":"042d3286-fb21-4c1f-ab19-3971b06480f7","resolution":{"observed_at":"2026-08-06T18:37:22.046731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:24.485936Z","title":"Text-guided graph neural networks for referring 3d instance segmentation.AAAI, 35(2):1610–1618, May 2021","venue":null,"work_id":"7255d11e-81c6-473f-93fa-43c7efcb8113","year":2021},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.255021Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:7b3a7bfeaad0173ce341399355a7e2ee0c6519546502f6df859673005034be21","observation_id":"2d6570b7-2cda-4a48-95c0-ecf1afc66378","resolution":{"observed_at":"2026-08-06T18:37:24.529985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:24.341251Z","title":"Dense object grounding in 3d scenes.ACM Multimedia, 2023","venue":null,"work_id":"c0d773ea-ce8e-4404-baa1-a4f91e740fab","year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.261876Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:c0811068f3918e7d9ac72f1a4268425f8c8120707bb6dafbfa2d089c7dbe1440","observation_id":"d9ac1b62-ec57-42e0-8d96-4246995d0ff7","resolution":{"observed_at":"2026-08-06T18:37:24.383244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:24.189958Z","title":"Sceneverse: Scaling 3d vision-language learning for grounded scene understanding","venue":null,"work_id":"826b112b-1936-4bda-b73a-6f838470118d","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.267560Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:96e052c14b4fbccdf968b6b6ff5fd84d7fdb8132eea09b730a80f10e9e978cb7","observation_id":"4471163f-cb6b-4db4-89ab-5737e3b369ce","resolution":{"observed_at":"2026-08-06T18:37:24.255373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13927","last_updated":"2025-08-03T11:03:07Z","snapshot_observed_at":"2026-08-06T21:55:14.213256Z","submitted_at":"2024-11-21T08:22:45Z","title":"Multimodal 3D Reasoning Segmentation with Complex Scenes","version":4},"cited_work":{"arxiv_id":"2411.13927","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.13927","snapshot_observed_at":"2026-08-06T18:37:21.795325Z","title":"Multimodal 3D Reasoning Segmentation with Complex Scenes","venue":"cs.CV","work_id":"92cd1fdc-5b0b-4430-a232-07c741097f01","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.273496Z"},"links":{"cited_paper":"/paper/2411.13927","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:57f9b545abf5addbc33a2a55483af25164c9389edd18f8dcab9b28a65fe61138","observation_id":"c9d89ce4-7ef4-476e-a7ca-79ec368e6539","resolution":{"observed_at":"2026-08-06T18:37:21.860973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:24.031160Z","title":"Intent3d: 3d object detection in rgb-d scans based on human intention","venue":null,"work_id":"f449583c-2626-4ae4-a73c-d428fd9b9ee9","year":2025},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.280081Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:c53c177c7d29a8977ea367f1da09c4b147346c8c0e959702c29228ebdd304b42","observation_id":"6c0c30db-6c45-4dbf-bf87-63ee7a7f99dd","resolution":{"observed_at":"2026-08-06T18:37:24.091965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:23.896557Z","title":"M3dbench: Towards omni 3d assistant with interleaved multi-modal instructions","venue":null,"work_id":"247937d6-ffbe-4305-8561-d9a255ac6dd0","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.288173Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:1f01a3fdcc832f5f6fa447fce32c3b9005bd80248dd713d6bc0a172160a76619","observation_id":"83c48785-f887-4b67-be35-c9b7c3c962ab","resolution":{"observed_at":"2026-08-06T18:37:23.955399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03201","last_updated":"2024-01-16T16:39:57Z","snapshot_observed_at":"2026-08-06T01:10:16.745527Z","submitted_at":"2024-01-06T12:20:18Z","title":"3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03201","snapshot_observed_at":"2026-08-06T18:37:21.293763Z","title":"3dmit: 3d multi-modal instruction tuning for scene understanding.arXiv preprint arXiv:2401.03201, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.293763Z"},"links":{"cited_paper":"/paper/2401.03201","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:98cb1c6efd8e26dc52241a94516cc64f5a290a1d1f8c01d4b3f437fe7c2ce772","observation_id":"362f372f-b1d3-4e5f-a3aa-0d1015d2618b","resolution":{"observed_at":"2026-08-06T18:37:21.293763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:23.762062Z","title":"Multi-modal situated reasoning in 3d scenes.NeurIPS, 2024","venue":null,"work_id":"423eb0d2-c55c-44ff-bc33-3849720b0cdb","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.299608Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:d0ff599185e1ecae3be20f8f686590dbcb023e2266ceccfd69c15a0cd0e89890","observation_id":"b948b5bd-2019-432c-820e-060b18784fe6","resolution":{"observed_at":"2026-08-06T18:37:23.821728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:23.557981Z","title":"See more and know more: Zero-shot point cloud segmentation via multi-modal visual data","venue":null,"work_id":"3f7629bc-143d-4c4c-b6df-84843bf58bba","year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.307224Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:cbe9922dc1a05467d94e3a46a002283be9a430915e23ced2c9d14c7dd1db3c2e","observation_id":"e141879a-7cc9-41f9-bcd1-4302cbbbcea4","resolution":{"observed_at":"2026-08-06T18:37:23.645328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:21.314108Z","title":"3dsrbench: A comprehensive 3d spatial reasoning benchmark.arXiv preprint arXiv:2412.07825, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.314108Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:5b91281c24ccf3b120f7bd32dc2f6008663fb3fb4cba0f56baf41263eb6f8bdc","observation_id":"346a79c3-8c57-4270-93cb-b5eba08d6163","resolution":{"observed_at":"2026-08-06T18:37:21.314108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:21.319192Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.319192Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:21061f2a55cde6e45708cc68983cc810ae61ed9df3c5253ae253510f80926e49","observation_id":"99404787-2c76-42ee-98e0-c7d6561e17b2","resolution":{"observed_at":"2026-08-06T18:37:21.319192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:23.360434Z","title":"X-refseg3d: Enhancing referring 3d instance segmentation via structured cross-modal graph neural networks","venue":null,"work_id":"1a0386f5-70e2-474c-a0fa-3b770a9b2411","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.324456Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:e1077175eabe21cb58080bbb6b549d48a67621b757cfb4508299801913dce94a","observation_id":"fd250474-66e0-431b-bd7d-d4b83e2ddde7","resolution":{"observed_at":"2026-08-06T18:37:23.395769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:23.235602Z","title":"Fully convolutional networks for semantic segmentation.IEEE TPAMI, 39(4):640–651, 2017","venue":null,"work_id":"abd149fb-16f6-48ad-84b8-b25aefde0ef6","year":2017},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.330745Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:a2996f8f463e085dc9d060c0196624a9b4c967c55195857795600048449ab0ec","observation_id":"181c2de8-7ad0-41ba-9f83-b112b78c4865","resolution":{"observed_at":"2026-08-06T18:37:23.282816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:23.117563Z","title":"Embodiedscan: A holistic multi-modal 3d perception suite towards embodied ai","venue":null,"work_id":"f6af8f32-3b93-413a-a373-8cd041254a85","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.337102Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:47b3d0b2394cda060d7050886204401782603c8fe51b2342b7f14bebfef0a7c0","observation_id":"644d44f1-f96e-423b-b35c-a0403c355991","resolution":{"observed_at":"2026-08-06T18:37:23.182958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08769","last_updated":"2023-08-17T03:52:15Z","snapshot_observed_at":"2026-08-02T00:22:05.597306Z","submitted_at":"2023-08-17T03:52:15Z","title":"Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08769","snapshot_observed_at":"2026-08-06T18:37:21.344604Z","title":"Chat-3d: Data- efficiently tuning large language model for universal dialogue of 3d scenes.arXiv preprint arXiv:2308.08769, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.344604Z"},"links":{"cited_paper":"/paper/2308.08769","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:04323bf9343cbb13f9a4243a2eea8794bd1796a6be226acc9cd15b3ad5f54b5d","observation_id":"3770243f-952a-4a6c-94dd-05f355ed0d06","resolution":{"observed_at":"2026-08-06T18:37:21.344604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:22.993886Z","title":"3d-stmn: Dependency-driven superpoint-text matching network for end-to-end 3d referring expression segmentation","venue":null,"work_id":"b91c0461-cea6-42b6-9abe-4aeb4ac94b3b","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.352680Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:434021facc0f744196803cfa89b956f05a7adbdaf0970d89ed916f986a1f65f1","observation_id":"b23ebd52-1067-4957-95b2-552b4f7e0a31","resolution":{"observed_at":"2026-08-06T18:37:23.052030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:22.875672Z","title":"Com- prehensive visual question answering on point clouds through compositional scene manipulation, 2023","venue":null,"work_id":"bd83d47f-34c2-45f4-99d4-720d711db301","year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.360014Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:fccebbb7daf007d086a4080bb0173efd213fcf7846636c5ca1646183861eaecd","observation_id":"eac10f64-5bb7-472e-a662-ba3269557217","resolution":{"observed_at":"2026-08-06T18:37:22.908862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:22.745191Z","title":"Fouhey, and Joyce Chai","venue":null,"work_id":"b637344d-a084-4b23-a2b6-f6e5045fba6b","year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.367267Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:ba83820444478df40ee834fa411912dee907e4e1a2a5c9fb8f91594be0bc9533","observation_id":"c2c71b5d-d935-4927-bd90-1dc2685e2feb","resolution":{"observed_at":"2026-08-06T18:37:22.814955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:21.375086Z","title":"Scannet++: A high-fidelity dataset of 3d indoor scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.375086Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:d6c08daeed139ec04c4e35bc2c3feea67ef3bf063d77b32c2378cd9fb5b0b843","observation_id":"e9854bb2-90b6-42a3-b153-64c907f4714c","resolution":{"observed_at":"2026-08-06T18:37:21.375086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17044","last_updated":"2025-03-21T11:00:12Z","snapshot_observed_at":"2026-07-06T20:56:40.518889Z","submitted_at":"2025-03-21T11:00:12Z","title":"ExCap3D: Expressive 3D Scene Understanding via Object Captioning with Varying Detail","version":1},"cited_work":{"arxiv_id":"2503.17044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17044","snapshot_observed_at":"2026-08-06T18:37:21.578219Z","title":"ExCap3D: Expressive 3D Scene Understanding via Object Captioning with Varying Detail","venue":"cs.CV","work_id":"6b7dc670-9ad5-4dcd-9125-818245ad9961","year":2025},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.381545Z"},"links":{"cited_paper":"/paper/2503.17044","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:d57c616e4ad082e6a51ed7bc37cbc1b7550b2ce012ad42f6692aafdb1e9989a1","observation_id":"30d36a3c-73ef-4ec8-8854-6d3fbf77c3c3","resolution":{"observed_at":"2026-08-06T18:37:21.594527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01821","last_updated":"2023-05-27T10:03:34Z","snapshot_observed_at":"2026-08-02T11:31:44.920642Z","submitted_at":"2022-07-05T05:50:12Z","title":"Toward Explainable and Fine-Grained 3D Grounding through Referring Textual Phrases","version":2},"cited_work":{"arxiv_id":"2207.01821","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.01821","snapshot_observed_at":"2026-08-06T18:37:21.527535Z","title":"Toward Explainable and Fine-Grained 3D Grounding through Referring Textual Phrases","venue":"cs.CV","work_id":"8bde4fd7-103b-49cc-b86a-18685ccc8187","year":2022},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.389400Z"},"links":{"cited_paper":"/paper/2207.01821","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:562bb2633b224552510d45516b5b1f9149232448e642f577fca2ef52de779824","observation_id":"6a899754-8dde-43f0-912c-07f2f9f8c2bb","resolution":{"observed_at":"2026-08-06T18:37:21.542408Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03540","last_updated":"2024-11-05T22:42:41Z","snapshot_observed_at":"2026-08-03T15:00:11.392314Z","submitted_at":"2024-11-05T22:42:41Z","title":"VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03540","snapshot_observed_at":"2026-08-06T18:37:21.399482Z","title":"Vla-3d: A dataset for 3d semantic scene understanding and navigation.arXiv preprint arXiv: 2411.03540, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.399482Z"},"links":{"cited_paper":"/paper/2411.03540","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:859d45b4de568aef4abd0811d0c5f2eb5e98f16de3808bebb5d0b6a87cb7a9b4","observation_id":"4253dfeb-ddb6-4e97-9581-e8379f3a1fde","resolution":{"observed_at":"2026-08-06T18:37:21.399482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01525","last_updated":"2024-07-17T07:07:43Z","snapshot_observed_at":"2026-08-05T00:22:51.049515Z","submitted_at":"2024-07-01T17:59:35Z","title":"ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01525","snapshot_observed_at":"2026-08-06T18:37:21.413309Z","title":"Scanreason: Empowering 3d visual grounding with reasoning capabilities.arXiv preprint arXiv: 2407.01525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.413309Z"},"links":{"cited_paper":"/paper/2407.01525","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:7c9c53e091bef785c9c99ee7589f3ee6bd7065914e8af8f3125e55c10bf85143","observation_id":"869ee334-947e-452a-a4cf-0c9bcf0a93f8","resolution":{"observed_at":"2026-08-06T18:37:21.413309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:37:22.517789Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":"5e5c1521-a764-4f27-bc7b-5597a52c5b28","year":2023},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.425460Z"},"links":{"citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:c738ef1ca37284eae7f5dc881a4efc1c11707c9ac371c924e8dc288c4c5a2bf2","observation_id":"773e9acc-2f00-4620-961d-89669b1f0225","resolution":{"observed_at":"2026-08-06T18:37:22.621098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":5,"verified_fuzzy":27},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 5 inbound Pith citation observations for arXiv:2507.07781."}