{"as_of":"2026-08-14T00:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b7a9d79e3a16b7b8175ea02ec7bd7cadc5e3453814652d5c2c27b4ebfcef8357","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T04:27:29.029373Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02980/citation-record","integrity":"/paper/2608.02980/integrity","json":"/paper/2608.02980/citation-record.json","paper":"/paper/2608.02980"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:30.177606Z","title":"ReferIt3D: Neural Listen- ers for Fine-Grained 3D Object Identification in Real-World Scenes","venue":null,"work_id":"0d5dfdb7-c65f-4748-a67c-796ed8d1deea","year":2020},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.719317Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:0683c4de797f3d2b77d124ebba72dc76b9b6ddd1d5e3b29e5f94391699d54303","observation_id":"aeb6dbff-f449-4e49-b91a-9442bef094cc","resolution":{"observed_at":"2026-08-08T04:27:30.183649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:30.159916Z","title":"Llama 3: The llama-3 herd of models.https: //ai.meta.com/llama/, 2024","venue":null,"work_id":"3a7dd0c4-cd66-4290-82e5-9dc8eb0835f6","year":2024},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.724810Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:c7214910fc8ab9582fc988a01f598ce18ebe5e4f65035ced086c9defbf4b0cac","observation_id":"1d6a1d8e-9086-4208-94a4-ffcdb6f39801","resolution":{"observed_at":"2026-08-08T04:27:30.165375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:30.142601Z","title":"Locate 3d: Real-world ob- ject localization via self-supervised learning in 3d, 2025","venue":null,"work_id":"bb60fe09-6ff8-4e52-a51c-42334e5a4eb0","year":2025},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.729999Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:d3b036ce63a22a1f47597e659a0565195e963df7ab7e8886911d6fdba2f31216","observation_id":"2705b699-df6a-4def-ba9e-90ca31a5b5a5","resolution":{"observed_at":"2026-08-08T04:27:30.148181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:30.124394Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"c3969fa9-4bad-43c7-b1ca-a21fa56e6ddb","year":2022},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.734941Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:b41d47467f0f6cccccdb4fc8090e95240c5815c888601a7957d7fb06014b7092","observation_id":"bf16414f-d807-45ae-885d-41f2b0be43cc","resolution":{"observed_at":"2026-08-08T04:27:30.129808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:30.107418Z","title":null,"venue":null,"work_id":"adf92a49-b810-42d3-bd56-2efabe2b90e3","year":2025},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.740493Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:b7e490ccac8a6f8ee57620e3cf6e94b54747eda75e3a4e0e81b5e8ce841b72bb","observation_id":"a53fa677-6872-40d5-97c4-0fd172862f17","resolution":{"observed_at":"2026-08-08T04:27:30.112824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:30.089765Z","title":"Token merging: Your ViT but faster","venue":null,"work_id":"e3bd66ff-b4cd-49cf-aa48-edb74cdeb0fc","year":2023},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.745801Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:996878ed98e0f6e83494648ceb2d7915a317cc0cc375035799943c74253904af","observation_id":"07d077cc-e702-40ff-b6d3-9e1d824d8e99","resolution":{"observed_at":"2026-08-08T04:27:30.095012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:30.072043Z","title":"From thousands to billions: 3d visual language grounding via render-supervised distillation from 2d vlms, 2025","venue":null,"work_id":"d0dadd97-2ff6-47b3-a0d0-7b7beb42ed58","year":2025},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.751420Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:f0dad26ef5f5ce0f1f06e8d58d0754479578cbf97fd64bde8fe827b2311e4cc0","observation_id":"0c2c2a72-6b94-49ed-823a-92146925c91d","resolution":{"observed_at":"2026-08-08T04:27:30.078294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:30.053329Z","title":"End- to-End Object Detection with Transformers","venue":null,"work_id":"1214deef-c8f3-4dbd-baa8-01f3b4f5fbb4","year":null},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.756349Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:e3f365b6eb1159cfbc08360b91e31eb58a3cdcdc4871d6f5db3727c9b12e94f7","observation_id":"558c4219-0243-4c7c-a0e5-5490ec30a8e7","resolution":{"observed_at":"2026-08-08T04:27:30.059219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06158","last_updated":"2017-09-18T20:34:48Z","snapshot_observed_at":"2026-08-02T16:47:23.623541Z","submitted_at":"2017-09-18T20:34:48Z","title":"Matterport3D: Learning from RGB-D Data in Indoor Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.06158","snapshot_observed_at":"2026-08-08T04:27:28.761505Z","title":"Matterport3d: Learning from rgb-d data in indoor environments.arXiv preprint arXiv:1709.06158, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.761505Z"},"links":{"cited_paper":"/paper/1709.06158","citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:2ab19952cb1637cc1f997dfca07dd339375167fe252955d8675e2cb8294a57da","observation_id":"ec62c190-df38-4cbf-8493-7fc304c59ed1","resolution":{"observed_at":"2026-08-08T04:27:28.761505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:30.032781Z","title":"ScanRefer: 3D Object Localization in RGB-D Scans using Natural Language","venue":null,"work_id":"e911d966-1713-4431-90fe-a4e40983b97e","year":2020},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.766679Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:8328e6c480fd50cfe4eb75327db618f8d349dc74220f61ba27d2800e5ae8ba02","observation_id":"9bb4ba43-8281-40f9-b5dc-512086bd13d1","resolution":{"observed_at":"2026-08-08T04:27:30.039282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:30.010541Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning","venue":null,"work_id":"f5a7be6d-d5e4-4230-be8b-02eadbbe16a2","year":2024},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.771739Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:4a8c7e982f6443dc6b32e75dd840090e25fd67624024bed475692b298c6dd21a","observation_id":"ca779a4b-4832-461b-8f06-d871b5697ef7","resolution":{"observed_at":"2026-08-08T04:27:30.017462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-13T00:05:34.358839Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-08T04:27:28.776677Z","title":"Grounded 3d-llm with referent tokens.arXiv preprint arXiv:2405.10370, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.776677Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:698107c00a1d0bc797ac4d7e1bd76b0c8e0c178635ce098d04f76bf3d0593295","observation_id":"619f4d38-021e-4b34-a0e4-bcd3f7a9c974","resolution":{"observed_at":"2026-08-08T04:27:28.776677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.990884Z","title":"Schwing, Alexan- der Kirillov, and Rohit Girdhar","venue":null,"work_id":"a7f4a217-d885-4960-814b-098483193ae2","year":2022},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.782179Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:60be472d57916b2c642a64dd28a00a37ba9573ae3098a49d9dce0f735c9eb087","observation_id":"7196c203-57d3-4550-bb01-9805a5c02bfb","resolution":{"observed_at":"2026-08-08T04:27:29.996076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.973968Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":"b7e43bb3-eeac-40ea-8bdc-7f533a9755a7","year":2017},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.787025Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:e4b16f75a9ff13f56db5a31a996e2727e47899bd9dfcd12986af0e68f55a49f0","observation_id":"ff2b045f-ce34-4731-8b73-0618518d85e3","resolution":{"observed_at":"2026-08-08T04:27:29.979160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.955881Z","title":"Bundlefusion: Real-time globally consistent 3d reconstruction using on-the-fly surface re-integration.ACM Transactions on Graphics 2017 (TOG),","venue":null,"work_id":"975b6411-cfb4-435f-a9b7-88567698e260","year":2017},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.791806Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:550e2aa1aa1ed6def38fd43180ad265e52f5942554f7c6c89c710298153be818","observation_id":"e479c723-70a6-4685-a861-2e2752513adf","resolution":{"observed_at":"2026-08-08T04:27:29.962201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-13T00:52:19.292622Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-08T04:27:28.796534Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning.arXiv preprint arXiv:2403.11401, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.796534Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:5d8848bbd252e415b876087d2c255fe0dc25e14e0aad32f243aacb741c2e3a9b","observation_id":"335a98b9-e5cf-4641-8d30-f44a2c5d3c9b","resolution":{"observed_at":"2026-08-08T04:27:28.796534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:28.802169Z","title":"3d-llm: In- jecting the 3d world into large language models.Advances in Neural Information Processing Systems, 36:20482–20494,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.802169Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:8324f09b1720802ed43d77e1b34e7879e1b127d3ea9dcd999d862e8d5ecdae2b","observation_id":"9d43c921-b730-4e1a-a0e7-c6ff566238d8","resolution":{"observed_at":"2026-08-08T04:27:28.802169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:28.807289Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen- Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.807289Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:2e4692817263b7ab77d5e328865823eff118c1b946832da7f3a26b4902e56670","observation_id":"4bcbb5c7-fc2b-41e5-a0ee-43312f09a4b7","resolution":{"observed_at":"2026-08-08T04:27:28.807289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.915657Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":"9448f93a-7930-4de8-965a-371c4cbadd3c","year":2024},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.812043Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:66de48e18d21547acc464849b79fe65de16708266ae26ec76ea6343c7caafc8b","observation_id":"0639deb9-e224-41af-832e-f8b83e7fa876","resolution":{"observed_at":"2026-08-08T04:27:29.921345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-08T04:27:28.816998Z","title":"An embodied generalist agent in 3d world.arXiv preprint arXiv:2311.12871, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.816998Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:6e06115a367ef721868d4e7c02960289377d74728e9ef91c9b4b9d34f5f12ac6","observation_id":"826b1c76-0114-4b09-a29b-1337a1ccb579","resolution":{"observed_at":"2026-08-08T04:27:28.816998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.899142Z","title":"Revisiting multimodal positional encoding in vision-language models, 2026","venue":null,"work_id":"dfe7af78-83c4-464b-8172-c5350cab6ed2","year":2026},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.822679Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:fb286f20d9defe88fdc31a8335d444a5705b8efd9a64dad4197bf0e35165d20b","observation_id":"da6b087d-9517-436b-b3b5-7d670b149057","resolution":{"observed_at":"2026-08-08T04:27:29.904945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.882599Z","title":"Reason3d: Searching and reasoning 3d segmentation via large language model.3DV, 2025","venue":null,"work_id":"a98b57d6-0140-4d69-9909-ba4703d45fb0","year":2025},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.827621Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:2c4ac6d33d922e19bde329cfd90fd14b40de77b16395a4bfbe42333b70386e5a","observation_id":"dc93f922-558f-492f-95c5-56de9aac65c1","resolution":{"observed_at":"2026-08-08T04:27:29.887836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.863421Z","title":"Bottom up top down detection transform- ers for language grounding in images and point clouds","venue":null,"work_id":"46b0f41e-238f-47c2-9b75-362a0cbf0960","year":2022},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.832603Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:5a153c0e6645f92da9cfe396d61d0786595a71485aee5bcb373f019a663357e1","observation_id":"6d18d69e-bbb6-403e-a26e-21a3aeeb3ec8","resolution":{"observed_at":"2026-08-08T04:27:29.869456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.845962Z","title":"Odin: A single model for 2d and 3d segmentation","venue":null,"work_id":"ea3ce342-5a00-4cd2-964b-3697ef5ebad4","year":2024},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.837664Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:82a3c7e93e904cbe969560a03ef17921be395ceead9613ae6b3ecbff1b42ffc3","observation_id":"00114ae5-a656-48af-af38-86faf6e5ad96","resolution":{"observed_at":"2026-08-08T04:27:29.850869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.827370Z","title":"Unifying 2d and 3d vision-language un- derstanding, 2025","venue":null,"work_id":"64201b1e-9f4f-4c48-a57d-fa0a3d830d4c","year":2025},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.842550Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:8a2d48bd1aff4a55c8188d21bc945c5ab360514cce25681c07e6762404efcffe","observation_id":"1f15f975-3b82-4750-8445-9ef82ff9df72","resolution":{"observed_at":"2026-08-08T04:27:29.832652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.809787Z","title":"MDETR - Modulated Detection for End-to-End Multi-Modal Under- standing","venue":null,"work_id":"b1e6bb0d-e4e8-485e-93fe-37d31fcac6e1","year":2021},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.847319Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:d28f3231842e7c8a40b77caeb80271955afc1af165613b6053753b480aeeceac","observation_id":"6594ca3a-8222-4c0b-9389-eafbf8bf2361","resolution":{"observed_at":"2026-08-08T04:27:29.814536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.791647Z","title":"ReferItGame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":"ffd464e1-c52d-4427-bb2e-aefaeb5550d2","year":2014},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.852077Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:73838ec539726745557bdf7635baf37bedcd38e7e72e7afc3f982a82caaddcf6","observation_id":"54add548-3d69-4b75-b0ed-14a7a4c44850","resolution":{"observed_at":"2026-08-08T04:27:29.797281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.774470Z","title":"Restr: Convolution-free referring image segmentation using transformers, 2022","venue":null,"work_id":"e6db29ce-de7f-4495-bca0-22ea2e71726c","year":2022},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.856930Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:dfb002a4f95d8b15362d53e6bb91fc376ea4401fa7d756bd8e462c6b3931d463","observation_id":"4df9d2ee-444b-4b06-8fcf-80a493fc90c8","resolution":{"observed_at":"2026-08-08T04:27:29.780428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:28.862157Z","title":"Mask-attention-free transformer for 3d in- stance segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.862157Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:9228b26a163e2e168ca07270248b7197ce89f2d15a274e4f99e64593e3938d19","observation_id":"7a97f72d-02bf-433a-9bf6-2406accc3ba8","resolution":{"observed_at":"2026-08-08T04:27:28.862157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.747034Z","title":"Lisa: Reasoning segmenta- tion via large language model, 2024","venue":null,"work_id":"1657fcec-59f5-4477-9801-73035a41e316","year":2024},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.867247Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:905a05c973dbc3dbb77af23e7b1746eed69e28396ea0c665aec3a4580e3df268","observation_id":"1fbc27d2-3930-4d67-b19e-c3dcb341710d","resolution":{"observed_at":"2026-08-08T04:27:29.752413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:28.872639Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.872639Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:1e3fefaca27a823ed18c86f36eda551cda965efe0656fed2f14e66e3600f10ea","observation_id":"2bc1063e-20fe-48e6-a533-28a0ba3899a5","resolution":{"observed_at":"2026-08-08T04:27:28.872639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.717281Z","title":"Grounded language-image pre-training","venue":null,"work_id":"6240c80e-e5c7-4b7e-b5a1-53bc24c7c449","year":2022},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.877707Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:2c2d0c3ef23acbcd9eb2d1fa6885e7cc2eeb3db33d2a767bc1a616362b5280af","observation_id":"990060e3-85a9-4452-b100-14f7a6892a78","resolution":{"observed_at":"2026-08-08T04:27:29.723467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.696663Z","title":"3eed: Ground everything everywhere in 3d","venue":null,"work_id":"58f7fe34-90a8-4edb-a495-b7280e8a87d2","year":2025},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.882564Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:bb834377842d3ca3cf6796250dc45879273ab568422c3a68cf60c8eb459e3898","observation_id":"d6cdb1fe-4044-4bc4-84f5-41148dfb81d4","resolution":{"observed_at":"2026-08-08T04:27:29.702798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.676307Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"009c23fe-477b-47a7-ac88-58023b5cc96f","year":2014},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.887595Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:ca389c9a2a2b44048e5d95e1d99a9cc7d5587f61e37a804c67cd2d528f3ba24a","observation_id":"fff96ced-d235-4551-8a5b-736904880d32","resolution":{"observed_at":"2026-08-08T04:27:29.682245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.657373Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":"60a2f527-8385-41f5-9972-338230e8cd53","year":2023},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.893221Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:f3e72b3eab52215ba97d61a03d79b66efee714642abc1b20395d0803c24d3ef6","observation_id":"679bd081-9eab-4124-b646-e150e493fdae","resolution":{"observed_at":"2026-08-08T04:27:29.662921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.640360Z","title":"View-on- graph: Zero-shot 3d visual grounding via vision-language reasoning on scene graphs","venue":null,"work_id":"d9619ea7-655a-412d-812c-ea39a4982b2b","year":2026},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.898167Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:b1e6eb18c87746af323a3f50b8e199830db80e09d30f14e772ae388ffd2b2e85","observation_id":"86f5f433-2743-4c66-9336-3161c0ddaef9","resolution":{"observed_at":"2026-08-08T04:27:29.646105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.622257Z","title":"3d-sps: Single-stage 3d visual grounding via referred point progressive selection","venue":null,"work_id":"6cc35ca0-d4da-46ca-9b26-d3bad5f6aab3","year":2022},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.903472Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:497f7164f07790d198b94265b796c3334d6049be074e16e6afc75b8b67fedd2b","observation_id":"e7e3f48c-5888-47b3-99cf-02e104416982","resolution":{"observed_at":"2026-08-08T04:27:29.627699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-13T14:05:27.706416Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-08T04:27:28.908340Z","title":"Sqa3d: Situated question answering in 3d scenes.arXiv preprint arXiv:2210.07474, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.908340Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:1ea34f2762df1d68d9f1cd228ac7698a8a207792497b4e48c4e7c398f0f24e9c","observation_id":"eaa2cf8c-ab49-4f40-9e22-9dd632d5699f","resolution":{"observed_at":"2026-08-08T04:27:28.908340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.604321Z","title":"Goucher, Adam Perelman, Aditya Ramesh, and Aidan Clark et al","venue":null,"work_id":"5f183569-15b5-444d-81fe-4a7b4dc09cf3","year":2024},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.913803Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:0f3d69401aefb268d094d5fb57aa62c37c3ad3d7217166e98c2fd39d052613bb","observation_id":"9f5db08d-fb08-4d91-97e2-a62a87f4d3cf","resolution":{"observed_at":"2026-08-08T04:27:29.610276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:28.918804Z","title":"Languagerefer: Spatial-language model for 3d visual grounding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.918804Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:f8bc02615a267f529ca492de62c11a4b62b6d41b38fe35a8097f9ac2158781ff","observation_id":"89d94f3b-0fd8-4117-84e4-7eb4187182f3","resolution":{"observed_at":"2026-08-08T04:27:28.918804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.572910Z","title":"Language- grounded indoor 3d semantic segmentation in the wild","venue":null,"work_id":"dcb1be75-a03c-428a-a478-daa1678ac899","year":2022},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.923771Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:d36ae759061ad073650293795d414e7bc0432ec7ad61fb84813aab6ce5921efb","observation_id":"804b1176-f87a-4488-82aa-f34154d5fdb3","resolution":{"observed_at":"2026-08-08T04:27:29.578334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.553733Z","title":"Mask3d: Mask trans- former for 3d semantic instance segmentation","venue":null,"work_id":"c6a20415-5b10-430c-962c-a1cb58d41403","year":2023},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.928579Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:684726f3e59db002c04717139e75b3c482a230a76e63aa967d64cdf0d3af1888","observation_id":"e8181c31-468e-47a5-9aaa-621d58963501","resolution":{"observed_at":"2026-08-08T04:27:29.558961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.534261Z","title":"Evaluating zero-shot gpt-4v performance on 3d vi- sual question answering benchmarks, 2024","venue":null,"work_id":"db2c2bb4-4f8f-4bfa-860f-d44dff88234f","year":2024},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.933509Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:f81b76dfc7916c169273a133562378adbf5ef7ebf91b87c485838df219912572","observation_id":"e85d7520-83ca-4c62-a919-c53c0a1894e0","resolution":{"observed_at":"2026-08-08T04:27:29.540015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.515398Z","title":"Hashimoto","venue":null,"work_id":"d505396e-b597-4af3-8137-37990f606686","year":2023},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.938741Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:88d99c4936f8014f70b269d906f3547a176be3fa1be0a1e722ba07f6a6c87786","observation_id":"fb31858b-2724-4037-a0f0-14fc4a0e0baa","resolution":{"observed_at":"2026-08-08T04:27:29.521967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.497428Z","title":"Gemini: A family of highly capable multimodal models, 2025","venue":null,"work_id":"1fec3747-5cc1-456a-8767-2579294a8cac","year":2025},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.944625Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:7730536f8d2f9b1a56f2e693b97acbd33828b3c7032c8aec0edbc9c50ddeed33","observation_id":"e7588881-b2a1-403d-981b-8ab81995c8c4","resolution":{"observed_at":"2026-08-08T04:27:29.502906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.481289Z","title":null,"venue":null,"work_id":"157e2afa-b82a-493f-a31a-f1f7e7314bec","year":2024},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.949602Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:70a5a54ed56321d1d5e366973515dea8498f9d2dff2966b68a0ff79488ddde2f","observation_id":"00d5c209-b687-46ef-930b-6564ef3fe0c7","resolution":{"observed_at":"2026-08-08T04:27:29.486307Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19115","last_updated":"2025-04-15T06:33:45Z","snapshot_observed_at":"2026-08-12T22:15:34.788779Z","submitted_at":"2024-10-24T19:29:02Z","title":"MoGe: Unlocking Accurate Monocular Geometry Estimation for Open-Domain Images with Optimal Training Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19115","snapshot_observed_at":"2026-08-08T04:27:28.954483Z","title":"Moge: Unlocking accurate monocular geometry estimation for open-domain images with optimal training supervision.arXiv preprint arXiv:2410.19115, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.954483Z"},"links":{"cited_paper":"/paper/2410.19115","citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:b72fe1620d5107ed35c838f330fdc5bf6b00d4e23b03a5c3bacdc5b82611158e","observation_id":"40bfa89e-34f3-4e62-89db-af3f72fd4069","resolution":{"observed_at":"2026-08-08T04:27:28.954483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.464404Z","title":"Realworldqa","venue":null,"work_id":"1200d7f9-e6a7-4622-96f2-2fed7f64f4b5","year":2024},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.959712Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:0c2c23203ecdb5ff811ae08315fb65c5910d1187a3ec0e230ff0624d5b2e6719","observation_id":"9dfa92bb-95b8-4e8f-a1ee-e45f1e9792f5","resolution":{"observed_at":"2026-08-08T04:27:29.469572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-08T04:27:28.964720Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.964720Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:ae39ffdb87d00094eface480d3b399a04ebc1a27f2972428849127cf8cbe4306","observation_id":"6889bd48-7bd7-473d-ad12-834ff21fc8c2","resolution":{"observed_at":"2026-08-08T04:27:28.964720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.447087Z","title":"Sat: 2d semantics assisted training for 3d visual grounding","venue":null,"work_id":"50ff011d-4b99-4398-94fa-d32aafbf08a1","year":2021},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.969841Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:42636d4c4fc02c818606b5d683a18eff217d1948ffef3e690327bb4c300de725","observation_id":"73561748-6326-40c7-8411-bbce61381ead","resolution":{"observed_at":"2026-08-08T04:27:29.452483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.430775Z","title":null,"venue":null,"work_id":"a8e61aa9-836f-4589-b9ef-1aa6dd4278d4","year":2022},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.974617Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:6a77086e17a2df83075082bc4eda2f732c227b8f84ffb6fe72f69889ee7cab31","observation_id":"08c79efa-76bc-4065-9f52-83fed13b6322","resolution":{"observed_at":"2026-08-08T04:27:29.435741Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:28.979475Z","title":"Scannet++: A high-fidelity dataset of 3d in- door scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.979475Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:2176d8a8580fbe4237c6926a1aab58abc0795eab665278b8834f31ff90640644","observation_id":"8e754b19-6361-4677-b4d2-9b35de80d58c","resolution":{"observed_at":"2026-08-08T04:27:28.979475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.403015Z","title":"Instancerefer: Cooperative holistic understanding for visual grounding on point clouds through instance multi-level contextual refer- ring","venue":null,"work_id":"4fcedb79-39d3-4698-86c1-ffee82905a7d","year":2021},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.984880Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:819d807ed11d6b20edae0864795c6f6915bde2d44a6cd5c10e11e4a8f29ad0b4","observation_id":"72dadb02-5187-48be-8e89-950c586ccd5d","resolution":{"observed_at":"2026-08-08T04:27:29.408883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.384905Z","title":"Multi3drefer: Grounding text description to multiple 3d ob- jects","venue":null,"work_id":"1f1d9f17-ee3d-408e-be2e-949eecf89f61","year":2023},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.989830Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:77735b2e3d673eca64e075b2b4f1daa8350712cfde72233585464c5c2974de15","observation_id":"a4be2bb5-2751-4d74-a4b4-c5f4ac0c264a","resolution":{"observed_at":"2026-08-08T04:27:29.391572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.365516Z","title":"Towards learning a generalist model for embod- ied navigation","venue":null,"work_id":"e9d88d19-1682-487c-abdd-41e3b22f9c2a","year":2024},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.994481Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:b1caac6e469124d1faba600b19b53efcff2a5375e4d9762d125b147a5a2a6a6f","observation_id":"7ba9a399-a68b-4a16-b07c-e8d9b19d776e","resolution":{"observed_at":"2026-08-08T04:27:29.371586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:28.999121Z","title":"Learning from videos for 3d world: Enhancing mllms with 3d vision geometry priors.arXiv preprint arXiv:2505.24625,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.999121Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:21238a1908efa98f6291237d0f0f31b1928457a62003c2f00ac57f28e0fb1db5","observation_id":"473c6c45-a62f-48ee-946f-aeb34c1cb832","resolution":{"observed_at":"2026-08-08T04:27:28.999121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.347954Z","title":"Video-3d llm: Learning position-aware video representation for 3d scene understanding","venue":null,"work_id":"719d5256-39f0-40b2-9162-b2f6e916c8ee","year":2025},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:29.004503Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:e3345fdc734635112b3cdfcc52cb28fb7972b7cf4754388b2a7b1632d141e4b4","observation_id":"1d49da31-7603-4865-8b38-9e7ca9fa0cb9","resolution":{"observed_at":"2026-08-08T04:27:29.353145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.331370Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness, 2024","venue":null,"work_id":"7f437d77-bcf4-4927-bacb-64873271c5df","year":2024},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:29.009579Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:1ced98b1ea76862806f2785dea35ff66a5bca919fbb5ba3bb18bfa9b860d09a9","observation_id":"bc1e7350-31e4-4b27-9f50-6a1eb06190e7","resolution":{"observed_at":"2026-08-08T04:27:29.336725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.314902Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":"9f153bfc-deda-4887-9010-ee44ee54e72f","year":2023},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:29.014371Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:c980d926562d0bc72a4c45470cbf9fa06cff6aaecd7a0d78914532c1dfb5adf1","observation_id":"aede57e3-b847-485b-8cae-c13d3ab279a2","resolution":{"observed_at":"2026-08-08T04:27:29.320100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11442","last_updated":"2024-07-24T07:31:37Z","snapshot_observed_at":"2026-08-13T00:04:26.905756Z","submitted_at":"2024-05-19T04:35:05Z","title":"Unifying 3D Vision-Language Understanding via Promptable Queries","version":2},"cited_work":{"arxiv_id":"2405.11442","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.11442","snapshot_observed_at":"2026-08-08T04:27:29.071573Z","title":"Unifying 3D Vision-Language Understanding via Promptable Queries","venue":"cs.CV","work_id":"c96968c9-b112-47e0-b89e-fadd55f8cda8","year":2024},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:29.019048Z"},"links":{"cited_paper":"/paper/2405.11442","citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:d383bc5983b759338092c2d21f43dd2746337c7a5d9e04656a51cf1616f3867d","observation_id":"87b2bc23-7840-435c-aa55-b96ad2a15573","resolution":{"observed_at":"2026-08-08T04:27:29.079215Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.298384Z","title":"Generalized decoding for pixel, image, and lan- guage","venue":null,"work_id":"d669fd6e-580c-4418-8454-d5089a9cf611","year":null},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:29.024405Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:da413d019e57e0c465c0141a9b623b4b9824b84dedc44a4cb6d872ce2baf33c3","observation_id":"5d76e898-d0c7-45e5-a8e8-862ac983013b","resolution":{"observed_at":"2026-08-08T04:27:29.303684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:27:29.281489Z","title":null,"venue":null,"work_id":"dbe4479e-ba72-4b13-b725-975d034b7474","year":null},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:29.029373Z"},"links":{"citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:9aa191f3d410dabf5f2b234438527bc9f7a280738ff61e98c723fabdc49ec4e2","observation_id":"78a29522-3b1a-456e-9cc1-91dc6ac60d28","resolution":{"observed_at":"2026-08-08T04:27:29.286999Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T21:17:25.644749Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":43},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2608.02980."}