{"as_of":"2026-08-08T05:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f9ebc5943bf93def7ea4f10da9493f7027b3816d10c4613a05c29b9f66a16971","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:12:19.747542Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T06:41:38.649424Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T06:45:29.442037Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2505.22429","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22429","snapshot_observed_at":"2026-07-01T06:45:29.442037Z","title":null,"venue":null,"work_id":"e5396650-8d81-4a12-bcab-15f63e4e057d","year":2025},"citing_paper":{"arxiv_id":"2606.31148","last_updated":"2026-06-30T05:21:11Z","snapshot_observed_at":"2026-07-30T15:10:27.559008Z","submitted_at":"2026-06-30T05:21:11Z","title":"PruneGround: Plug-and-play Spatial Pruning for 3D Visual Grounding","version":1},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-07-01T06:41:38.649424Z"},"links":{"cited_paper":"/paper/2505.22429","citing_paper":"/paper/2606.31148"},"observation_digest":"sha256:9c629bdceca168a26d0a2c7fe63febd652f40d487888797cfc3ccd379a1ef875","observation_id":"7e135835-ad52-43f6-9e78-62ef14a3da16","resolution":{"observed_at":"2026-07-01T06:45:29.444056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22429/citation-record","integrity":"/paper/2505.22429/integrity","json":"/paper/2505.22429/citation-record.json","paper":"/paper/2505.22429"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:33.010397Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language,","venue":null,"work_id":"343e4ed7-a99a-4bdb-88a3-ca7cdedf0283","year":2020},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:13.394174Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:2df58d42a439eb52ba99d50740053a4bf41b2b543f2418654b795c6012e8950a","observation_id":"960747c0-afc7-4659-b22b-4e9984151d05","resolution":{"observed_at":"2026-08-07T13:12:33.112862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19629","last_updated":"2023-12-17T01:19:13Z","snapshot_observed_at":"2026-08-03T17:06:57.120730Z","submitted_at":"2023-10-30T15:22:50Z","title":"RayDF: Neural Ray-surface Distance Fields with Multi-view Consistency","version":2},"cited_work":{"arxiv_id":"2310.19629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.19629","snapshot_observed_at":"2026-08-07T13:12:21.214057Z","title":"RayDF: Neural Ray-surface Distance Fields with Multi-view Consistency","venue":"cs.CV","work_id":"9966a3a6-5ef4-44cf-a9cc-872e99608147","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:13.502388Z"},"links":{"cited_paper":"/paper/2310.19629","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:00e0da677f2012088960647d36bcd2fde0fc5adcb1cfbd5b2577aac74ae14715","observation_id":"8b9a2380-ea31-4728-a03e-027b0f870747","resolution":{"observed_at":"2026-08-07T13:12:21.282429Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:32.810033Z","title":"Deep view synthesis via self-consistent gen- erative network,","venue":null,"work_id":"6c0774cd-e728-4cb6-b130-d7b9518f96b4","year":2021},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:13.596606Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:dc2dc6040b8bdbe6a811431d8f122b99e6b9217525c1ad17c1587b9e9f9ce02b","observation_id":"dbfea0d5-1991-4263-ac19-3d58190694cb","resolution":{"observed_at":"2026-08-07T13:12:32.931597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14423","last_updated":"2025-05-08T08:27:10Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:55:23Z","title":"PhysFlow: Unleashing the Potential of Multi-modal Foundation Models and Video Diffusion for 4D Dynamic Physical Scene Simulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14423","snapshot_observed_at":"2026-08-07T13:12:13.660944Z","title":"Unleashing the potential of multi-modal foun- dation models and video diffusion for 4d dynamic physical scene simulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:13.660944Z"},"links":{"cited_paper":"/paper/2411.14423","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:55fdcb47d9abe1cd0953be6956f46579d3764182b49911fe73f6eec67a8cb3ef","observation_id":"e3b704f0-aab2-4e93-86ab-32d1e3515bac","resolution":{"observed_at":"2026-08-07T13:12:13.660944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06136","last_updated":"2025-04-26T10:11:56Z","snapshot_observed_at":"2026-07-06T17:27:45.481850Z","submitted_at":"2024-02-09T01:48:44Z","title":"SIR: Multi-view Inverse Rendering with Decomposable Shadow Under Indoor Intense Lighting","version":4},"cited_work":{"arxiv_id":"2402.06136","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.06136","snapshot_observed_at":"2026-08-07T13:12:20.968304Z","title":"SIR: Multi-view Inverse Rendering with Decomposable Shadow Under Indoor Intense Lighting","venue":"cs.CV","work_id":"5e68ffe9-f202-43ee-ab51-a3b32f14952a","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:13.744633Z"},"links":{"cited_paper":"/paper/2402.06136","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:e7ebc23beecfb353bdad34c87d74c34f981789ebbb460891a556454bf7fbebd2","observation_id":"57a6e328-f12f-4ab9-af53-7caa8174205f","resolution":{"observed_at":"2026-08-07T13:12:21.087050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10509","last_updated":"2024-03-30T16:09:14Z","snapshot_observed_at":"2026-07-06T16:08:21.060375Z","submitted_at":"2023-08-21T06:50:29Z","title":"An Examination of the Compositionality of Large Generative Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2308.10509","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.10509","snapshot_observed_at":"2026-08-07T13:12:20.773404Z","title":"An Examination of the Compositionality of Large Generative Vision-Language Models","venue":"cs.CL","work_id":"57bb5ef8-abb5-4790-b58d-518ac2ec3ab6","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:13.802829Z"},"links":{"cited_paper":"/paper/2308.10509","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:b0b7e55e8cd328a440d42b66039a08bcb02b547d2adf11915564abc31282365f","observation_id":"4f6dd310-9524-424d-8221-e830ebea8546","resolution":{"observed_at":"2026-08-07T13:12:20.851836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:32.639677Z","title":"Think global, act local: Dual-scale graph transformer for vision-and-language navigation,","venue":null,"work_id":"63aa49c3-e3ac-4523-ac89-577521630871","year":2022},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:13.940140Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:4e75fd3882ff7652aebf9330d5ae1d54fb93f95256a5e85c74d5df110b3713b7","observation_id":"aa17f378-4420-4b33-b61d-de83946f313d","resolution":{"observed_at":"2026-08-07T13:12:32.731576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:32.488288Z","title":"Assister: Assistive navigation via condi- tional instruction generation,","venue":null,"work_id":"5c8896ab-05f2-4018-97b5-be174e122a76","year":2022},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.029025Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:5abcbf790c4f9a201c971a14695672e79d1bc4b95dc1db92c97c0151e2faf4b2","observation_id":"330b875b-8571-4c73-ae2c-62fa7c4aaeb1","resolution":{"observed_at":"2026-08-07T13:12:32.568017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13244","last_updated":"2025-02-08T15:07:56Z","snapshot_observed_at":"2026-08-06T15:15:33.337398Z","submitted_at":"2024-09-20T06:08:24Z","title":"From Cognition to Precognition: A Future-Aware Framework for Social Navigation","version":2},"cited_work":{"arxiv_id":"2409.13244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.13244","snapshot_observed_at":"2026-08-07T13:12:20.612785Z","title":"From Cognition to Precognition: A Future-Aware Framework for Social Navigation","venue":"cs.RO","work_id":"21cc52c8-96ef-40a8-923f-9058f429d3d0","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.101940Z"},"links":{"cited_paper":"/paper/2409.13244","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:96b62419a43fee04deb47ca0e114033ea41451a9d0c74297a030ab20deda6268","observation_id":"9f53beb9-7803-4995-a8ac-6306a5f28797","resolution":{"observed_at":"2026-08-07T13:12:20.654751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:32.346422Z","title":"Clip2scene: Towards label-efficient 3d scene understanding by clip,","venue":null,"work_id":"3e948672-ee1c-4b8d-b9da-f1028e0be441","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.175634Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:bbe9aa217549e2dd1c21ce6fd0bc3ef1981ed57aa50b0d97c2c07683ebc7097f","observation_id":"dd10ce10-0d22-4d89-9acd-dcdaeb9deac4","resolution":{"observed_at":"2026-08-07T13:12:32.413691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:32.181033Z","title":"Robo3d: Towards robust and reliable 3d perception against corruptions,","venue":null,"work_id":"d20ab5ce-328f-409a-bd3c-c8e3a5772374","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.211674Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:db2075f1ae387cd94ec99f0df1d227663c53b29b6b717641da374c2946403421","observation_id":"31d13b7b-2b84-4766-85e6-5592b983dad8","resolution":{"observed_at":"2026-08-07T13:12:32.257194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:32.014272Z","title":"Rethinking range view representation for lidar segmentation,","venue":null,"work_id":"7d635e4f-0dd0-4835-b4a7-177f5e0a3861","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.269354Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:f731e2979db082b6425a8ff9af2005d425fc9f95f20646a3fd4ebb95d56e3614","observation_id":"c1d22c9f-0892-4398-8716-e2d9ccbc6a59","resolution":{"observed_at":"2026-08-07T13:12:32.093229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:31.815046Z","title":"Xvo: Generalized visual odometry via cross- modal self-training,","venue":null,"work_id":"0c8753c6-976a-4f4c-ae68-7b2d110e3cf6","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.340641Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:0d97d58269628705f4bf8414cc961e15b14207c743a9665d0bf46835bfa25368","observation_id":"2bedc6dc-5cfb-46f0-91a9-202261a576b1","resolution":{"observed_at":"2026-08-07T13:12:31.912696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01784","last_updated":"2022-10-08T03:42:10Z","snapshot_observed_at":"2026-08-07T16:45:51.835105Z","submitted_at":"2022-10-04T17:54:53Z","title":"COARSE3D: Class-Prototypes for Contrastive Learning in Weakly-Supervised 3D Point Cloud Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01784","snapshot_observed_at":"2026-08-07T13:12:14.416591Z","title":"Coarse3d: Class-prototypes for contrastive learning in weakly-supervised 3d point cloud segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.416591Z"},"links":{"cited_paper":"/paper/2210.01784","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:56f2e1a59eadc4324e37ec36e27129a6ab69cd814f58ab7f8bc29b2b7f8441b0","observation_id":"03bfdf04-2234-4fe5-a716-86bba0b57d4b","resolution":{"observed_at":"2026-08-07T13:12:14.416591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:31.643171Z","title":"Perception-aware multi-sensor fusion for 3d lidar semantic segmentation,","venue":null,"work_id":"59fa8c42-8dc1-4518-873e-09c56778f51d","year":2021},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.467600Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:7ebdcb0ed9ebb04552be0f698a3f652fba4b4864cc654348805c2ce36aa6430c","observation_id":"fa261fc4-6dda-44f3-a79d-88fba013e8b5","resolution":{"observed_at":"2026-08-07T13:12:31.722848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:31.464754Z","title":"Epmf: Efficient perception-aware multi- sensor fusion for 3d semantic segmentation,","venue":null,"work_id":"71582b1e-018d-49a2-9e45-7dded212a75c","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.521529Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:55a14cc2a536a99a47d7d8004a202806690f7f6370e912f8b976280f39527674","observation_id":"6b23063d-3182-489e-ae81-83d3d6d434eb","resolution":{"observed_at":"2026-08-07T13:12:31.545958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:31.299345Z","title":"Tfnet: Exploiting temporal cues for fast and accurate lidar semantic segmentation,","venue":null,"work_id":"a5e0345c-dda4-426f-8b06-67e2e8fb5c01","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.602509Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:33f3946d64acab76ff044dbea94e67d9bba6243e6f22f3c0aec2c05ba6dba188","observation_id":"1040d8e3-f317-4bd5-8225-322ce41fcea5","resolution":{"observed_at":"2026-08-07T13:12:31.385278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12177","last_updated":"2024-11-19T02:40:42Z","snapshot_observed_at":"2026-07-06T19:52:20.541067Z","submitted_at":"2024-11-19T02:40:42Z","title":"Robust 3D Semantic Occupancy Prediction with Calibration-free Spatial Transformation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12177","snapshot_observed_at":"2026-08-07T13:12:14.678694Z","title":"Robust 3d semantic occupancy prediction with calibration-free spatial transformation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.678694Z"},"links":{"cited_paper":"/paper/2411.12177","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:d6bebd41b4cf95effacb4c88c0f804deceeef331230d05f5aadcc61806a3d6fe","observation_id":"dd2fa089-3b28-4518-a393-274e9128ad3c","resolution":{"observed_at":"2026-08-07T13:12:14.678694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:31.067294Z","title":"Dhp-mapping: A dense panoptic mapping sys- tem with hierarchical world representation and label opti- mization techniques,","venue":null,"work_id":"e3b55b00-c740-4e8b-8dd0-e7c62657a1e1","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.771248Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:4adfbae93bf82178260c50293785b96ef8f6bddfe219b07a85e5c041b0116bfd","observation_id":"6adcb6dd-1a21-4311-bcf5-680846d8444c","resolution":{"observed_at":"2026-08-07T13:12:31.170166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:30.864178Z","title":"Multi-modal data-efficient 3d scene un- derstanding for autonomous drivin,","venue":null,"work_id":"4b45e786-bf3a-4001-ba09-781feb459062","year":2025},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.854042Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:9881843734a16dccc55cac141831dc11ec0c9f31a65e237be5f80644edd732c3","observation_id":"dd1c1904-35de-4441-b3eb-dd532efb8937","resolution":{"observed_at":"2026-08-07T13:12:30.987688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:14.916380Z","title":"Dynamiccity: Large-scale 4d occu- pancy generation from dynamic scenes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.916380Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:2b37a9263a7ed0c6556e75bf8c0e8e2817a251ec4e6b6d8612efd1badec2ab49","observation_id":"77efeec2-affe-46a1-8e6c-5590ca719030","resolution":{"observed_at":"2026-08-07T13:12:14.916380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:30.633341Z","title":"Calib3d: Calibrating model preferences for reliable 3d scene understanding,","venue":null,"work_id":"15c33529-3738-483b-a3f0-978f694783f4","year":1965},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.013655Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:52a4fb4f986b7cdc0fd0989df81d1fdce6c609a6c3a05b7d2c45430b49626649","observation_id":"21947037-35b4-4109-83a4-c704eadff963","resolution":{"observed_at":"2026-08-07T13:12:30.705023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:30.443443Z","title":"Bottom up top down detection transform- ers for language grounding in images and point clouds,","venue":null,"work_id":"011c5e41-e338-4604-a8d8-0a992e88df35","year":2022},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.130922Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:935215e39cb2539123d17bb81e8b20a365ea2f819a7089f7c4b9e65e1bf79e8a","observation_id":"5c6df824-f55a-43df-b72b-d33033b5e4f1","resolution":{"observed_at":"2026-08-07T13:12:30.534444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:30.227439Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment,","venue":null,"work_id":"59cfadd7-61b1-4490-a757-0ffecc7d073d","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.204457Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:d9c37b84f6dd5e1b82c36c5a254686a7528b2e51f09df7671fa07c8491ef4c3c","observation_id":"bc2adfb0-b5bc-4cec-8761-c20b7c790c46","resolution":{"observed_at":"2026-08-07T13:12:30.315718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:30.080473Z","title":"Eda: Explicit text-decoupling and dense align- ment for 3d visual grounding,","venue":null,"work_id":"448e9e92-05c2-48e4-b996-8e78ffe35c7d","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.273293Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:973ee86d551c0cda0b570cdcb5b49d06b35eaa95fcf4113e83abd41a94ff3256","observation_id":"7c0380bf-1754-4b5b-91dd-f9bc7301825e","resolution":{"observed_at":"2026-08-07T13:12:30.141405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:29.881196Z","title":"3dvg-transformer: Relation modeling for vi- sual grounding on point clouds,","venue":null,"work_id":"4310931d-f120-47de-96c4-78f42872b68a","year":2021},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.322438Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:c2d7668afa8989281c4902b17dc074fafc1a05eecbf40792857c0b0afa94eb27","observation_id":"d50e43f0-cf9a-41c7-b7b3-64936739d156","resolution":{"observed_at":"2026-08-07T13:12:30.002253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:29.759496Z","title":"Instancerefer: Cooperative holistic under- standing for visual grounding on point clouds through in- stance multi-level contextual referring,","venue":null,"work_id":"b8e1d6ec-c2f3-42df-b7c4-4f205d6bf946","year":2021},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.400260Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:2ec500c39b20c5f119dcbbeaf1443f9acf400c29ac498fa010156c9478502a91","observation_id":"bd712acb-4ec8-4fd0-bc3f-3c2a28ce6d8f","resolution":{"observed_at":"2026-08-07T13:12:29.817183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:29.528907Z","title":"Multi-branch collaborative learning network for 3d visual grounding,","venue":null,"work_id":"1c4a5606-bb68-4237-82c0-da6c48957ee2","year":2025},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.451650Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:1d25b92a6f6972e58ff4c78f7277bdaaf9f91a4c459a4317b9ebbbf43d1b6232","observation_id":"f3b330c4-f015-42f9-86e6-d02a4f2ff0f9","resolution":{"observed_at":"2026-08-07T13:12:29.648448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:29.386478Z","title":"Semantickitti: A dataset for semantic scene understanding of lidar sequences,","venue":null,"work_id":"70f2aaf2-1df5-4678-b1ea-c517d705ca5b","year":2019},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.491354Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:95ad916ad19f636b42146d180b36acecff9f5cc3611fa27e3e524f5712034c5f","observation_id":"5f07f699-f8bc-441a-8085-dcc8ec68e53d","resolution":{"observed_at":"2026-08-07T13:12:29.457192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:29.109474Z","title":"Scalability in perception for autonomous driv- ing: Waymo open dataset,","venue":null,"work_id":"de88dd7f-c2b5-4250-b076-9bb7995928bd","year":2020},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.564839Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:8f6aedaf709f2e4838694aaed1716bdaa5cc25645b2d9e207028dac69368c698","observation_id":"2f3a2f58-fa72-4e45-9ff5-3861b4926bab","resolution":{"observed_at":"2026-08-07T13:12:29.255587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:28.899414Z","title":"Panoptic nuscenes: A large-scale bench- mark for lidar panoptic segmentation and tracking,","venue":null,"work_id":"44c33770-6107-4051-96b9-832ce98b7514","year":2022},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.623601Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:cc231625b74b1f4d97bcbf97e34133a088500ccf514a0e7ff4f1b8342edf2ac2","observation_id":"7354791c-6c9e-4f60-956a-af68e73e773c","resolution":{"observed_at":"2026-08-07T13:12:29.002623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:28.650386Z","title":"Visual programming for zero-shot open- vocabulary 3d visual grounding,","venue":null,"work_id":"2d7440dd-2e3a-4bc5-837b-bbbf3380475f","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.701053Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:facfde89a16e70cb6bf512fb6aa554facdc259c1720121401993334e62530910","observation_id":"11375c3b-8862-4593-bad2-7761dfc1ac0e","resolution":{"observed_at":"2026-08-07T13:12:28.773037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:28.449590Z","title":"Llm-grounder: Open-vocabulary 3d visual grounding with large language model as an agent,","venue":null,"work_id":"54519a0d-cec8-437b-ab67-5bbed6f92d0b","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.776796Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:dcbb165a569c274a593aa8f0f53aaad4bfcda7ebbdba5b9328bfc6107788296a","observation_id":"a012d746-72fe-44e3-bdeb-0d1aee487572","resolution":{"observed_at":"2026-08-07T13:12:28.545584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:28.168223Z","title":"Training language models to fol- low instructions with human feedback,","venue":null,"work_id":"4d6dd1f6-938b-4149-aff6-7663da807457","year":2022},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.878975Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:cb29e1aef7de02fc1a2f5b31d451ed23fa671f3cf54f126718ab896bd600774d","observation_id":"c155db64-fdc3-4454-8b88-6e86c1baba4a","resolution":{"observed_at":"2026-08-07T13:12:28.325098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:12:15.966014Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.966014Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:bd6508502632a7cb4b8cd8936ae60cd13bb40ef83cc7bf5283841b3604fcf32d","observation_id":"1e1b7fb4-f508-42b6-8fab-a9bf6ea0c806","resolution":{"observed_at":"2026-08-07T13:12:15.966014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:12:16.033226Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.033226Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:12cda3d8c773fc4657c8b981862bf224bc8655c144c716a92809333b29de49d7","observation_id":"3579b74e-7593-4f22-8ebb-e28f7c17fb6a","resolution":{"observed_at":"2026-08-07T13:12:16.033226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-05T11:54:14.447608Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T13:12:16.099070Z","title":"Cogvlm2: Visual language mod- els for image and video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.099070Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:354e1754f0ffc9c2844aa209db577c163c61aea3e905b309b3bc8e827458730b","observation_id":"5426ae40-e7e6-4ba6-bb60-6b115f0d2f4a","resolution":{"observed_at":"2026-08-07T13:12:16.099070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:27.965384Z","title":"Sceneverse: Scaling 3d vision-language learn- ing for grounded scene understanding,","venue":null,"work_id":"49801c0b-9ab1-4377-b4df-eb33530fdef6","year":2025},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.172492Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:b7bc3c31ddfc72e5e6fee2376bfa32dd898662f974187b923ea1cc5303f9b2ad","observation_id":"63c38e4a-105a-4267-8616-ce139f488a22","resolution":{"observed_at":"2026-08-07T13:12:28.062525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04383","last_updated":"2025-05-29T14:14:03Z","snapshot_observed_at":"2026-08-02T23:47:39.393363Z","submitted_at":"2024-12-05T17:58:43Z","title":"SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04383","snapshot_observed_at":"2026-08-07T13:12:16.243728Z","title":"Seeground: See and ground for zero- shot open-vocabulary 3d visual grounding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.243728Z"},"links":{"cited_paper":"/paper/2412.04383","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:0032343873512638c916f8d61669e97433203d842426111c733f55f2416b07ef","observation_id":"37219787-af06-4101-8af5-57e158d3730c","resolution":{"observed_at":"2026-08-07T13:12:16.243728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:27.727831Z","title":"Referit3d: Neural listeners for fine- grained 3d object identification in real-world scenes,","venue":null,"work_id":"05824762-cf46-4d68-a700-66dd37bea9f4","year":2020},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.327105Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:674934a6fd551cad666eef5389500d48cf3ee33d80169f529345a916c789a38b","observation_id":"dd2be870-d9b6-4bae-b676-1b4ff513377a","resolution":{"observed_at":"2026-08-07T13:12:27.868411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:27.467832Z","title":"Viewrefer: Grasp the multi-view knowledge for 3d visual grounding,","venue":null,"work_id":"e71f3e34-cb13-4f08-a72b-1caca2f3097a","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.383282Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:a6c5a5a651862bcfbb4a43993ecc97c6c9c82a209ea931c45ad27bc953233c53","observation_id":"1c3d62e2-a284-4093-9485-c07bfd12986b","resolution":{"observed_at":"2026-08-07T13:12:27.642877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:27.194767Z","title":"Multi-view transformer for 3d visual grounding,","venue":null,"work_id":"b47b72b4-3137-4184-9160-3e32b57c3aad","year":2022},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.457874Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:c2d9755f2071a2f23b291a38ab262d4e2a0bcf1d9c06823276c82cc1efc88183","observation_id":"a70094c3-e7ce-4b6c-8fc8-cb4d1670b286","resolution":{"observed_at":"2026-08-07T13:12:27.299693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:27.008616Z","title":"Look around and refer: 2d synthetic se- mantics knowledge distillation for 3d visual grounding,","venue":null,"work_id":"1fa4f320-8344-4710-a985-8638713a625e","year":2022},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.537325Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:f8d0bcf82db8e4a876a79e27773e4fd091a33809d31b0c0dd4c08567b75717f5","observation_id":"9229b3cc-9dcb-4273-9701-4f45767296f1","resolution":{"observed_at":"2026-08-07T13:12:27.103416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:26.679441Z","title":"Sat: 2d semantics assisted training for 3d visual grounding,","venue":null,"work_id":"1fd06918-56b0-4063-acdf-f6adaf1e6c58","year":2021},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.586571Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:f5d52ad5dc202e81ea973e0077e126ae9eb9f880f3b85ed40155e5f1bd7e73af","observation_id":"d6ce677b-b1b6-4488-b020-89df092fe040","resolution":{"observed_at":"2026-08-07T13:12:26.794171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:26.491287Z","title":"Four ways to improve verbo-visual fusion for dense 3d visual grounding,","venue":null,"work_id":"0e53bdee-eb08-40be-b3b3-a05b7929ff54","year":2025},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.657203Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:93de8d90e1ae67f21549c03946d4576b5add58258a42e1454be2ba8bb1319e2f","observation_id":"1ca3c590-6dea-4a27-874d-747b1befea47","resolution":{"observed_at":"2026-08-07T13:12:26.612752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:26.273318Z","title":"Distilling coarse-to-fine semantic matching knowledge for weakly supervised 3d visual grounding,","venue":null,"work_id":"aa6be4e7-687a-4896-af3b-dab309878fe1","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.723540Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:b6d15674e6491b2a15b1cbac65142f91c7b4f5cdc09ebf8f3bf27fd861378c5c","observation_id":"8b9e7394-52c4-4635-90bc-357d17e6ace1","resolution":{"observed_at":"2026-08-07T13:12:26.393051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:26.065650Z","title":"Unifying 3d vision-language understanding via promptable queries,","venue":null,"work_id":"ad38b879-b5d4-433f-8705-7a3a63af93f9","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.772423Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:f875cac0c56cdba9e22485fa1db08fd3f68a78c71d874f873e718a1a4f95366b","observation_id":"8ad91c79-521c-4f81-8bfc-9e2577bc4909","resolution":{"observed_at":"2026-08-07T13:12:26.169590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00326","last_updated":"2024-12-31T07:55:35Z","snapshot_observed_at":"2026-08-07T10:41:45.025090Z","submitted_at":"2024-12-31T07:55:35Z","title":"OVGaussian: Generalizable 3D Gaussian Segmentation with Open Vocabularies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00326","snapshot_observed_at":"2026-08-07T13:12:16.828825Z","title":"Ovgaussian: Generalizable 3d gaus- sian segmentation with open vocabularies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.828825Z"},"links":{"cited_paper":"/paper/2501.00326","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:abc03d10114425860dc97319f7002fd3004140b7d60f6f13a8b277523e9b8dd9","observation_id":"f858176d-4543-448f-94e2-5417467643c2","resolution":{"observed_at":"2026-08-07T13:12:16.828825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:25.871546Z","title":"Multi-space alignments towards universal lidar segmentation,","venue":null,"work_id":"4787de41-bdb3-4c8f-8e1e-92fcdbb242df","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.895168Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:01c2bff0a0711202455311611375310fad1693a68f6505dc0cb92f4d25419609","observation_id":"b52141f5-02d0-4ff5-8e29-8998abfa1c46","resolution":{"observed_at":"2026-08-07T13:12:25.960756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:25.628803Z","title":"Towards label-free scene understanding by vision foundation models,","venue":null,"work_id":"9cff2eff-c634-49b8-856d-b94ccf6d8d77","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.967579Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:003c0a3c14bd4b282339e3de9c492a4f67f65265638a6d6c2d312d95f1c85e52","observation_id":"02ec2c3f-ff86-42ff-8ffb-34b28baecacf","resolution":{"observed_at":"2026-08-07T13:12:25.756569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04004","last_updated":"2025-03-20T13:53:48Z","snapshot_observed_at":"2026-07-31T23:48:32.075556Z","submitted_at":"2025-01-07T18:59:58Z","title":"LiMoE: Mixture of LiDAR Representation Learners from Automotive Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04004","snapshot_observed_at":"2026-08-07T13:12:17.070727Z","title":"Limoe: Mixture of lidar representation learners from automotive scenes,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.070727Z"},"links":{"cited_paper":"/paper/2501.04004","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:6129f882b3288512bbb6905269c7f0f0be7013ae7dfb651ee8fd4b6dec513a59","observation_id":"72357686-fe9d-482c-a614-4c8e5f09b4b6","resolution":{"observed_at":"2026-08-07T13:12:17.070727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09511","last_updated":"2024-12-12T17:59:03Z","snapshot_observed_at":"2026-08-03T23:53:01.564520Z","submitted_at":"2024-12-12T17:59:03Z","title":"GEAL: Generalizable 3D Affordance Learning with Cross-Modal Consistency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09511","snapshot_observed_at":"2026-08-07T13:12:17.150193Z","title":"Geal: Generalizable 3d affordance learning with cross-modal consistency,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.150193Z"},"links":{"cited_paper":"/paper/2412.09511","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:67645e5f6bdacfa1ec3f82955b7d8ff73ae9e59b1531c97d123739339a616dee","observation_id":"197f289d-d06e-4527-8ea0-b7333f8cc82a","resolution":{"observed_at":"2026-08-07T13:12:17.150193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:25.367413Z","title":"Openscene: 3d scene understanding with open vocabularies,","venue":null,"work_id":"03452b1a-803e-4b24-bef5-3ec110e91aff","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.213896Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:81be62f2c77c78d3b5f75179d42380c1464b8097b0f94d1ed11f22df4e3514e1","observation_id":"030e2204-a25d-4b24-a0b4-3397826df452","resolution":{"observed_at":"2026-08-07T13:12:25.487986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:25.119209Z","title":"Lerf: Language embedded radiance fields,","venue":null,"work_id":"80a9b62b-f34e-41b9-a07f-dfbb9d17ff3e","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.283351Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:27e7f47575c14480bc6711ce9ca5250dc6925fafa706ec6d56e7eb102af30c43","observation_id":"423967c6-2e0e-4c80-bcf4-565da2f9c4d3","resolution":{"observed_at":"2026-08-07T13:12:25.225323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:24.887766Z","title":"Ovir-3d: Open-vocabulary 3d instance retrieval without training on 3d data,","venue":null,"work_id":"66c359f5-e695-4602-a50e-816a1f539d0f","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.343736Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:7bec8dba032fa5eedc699c09d7297d39c721cca9a73aa1a8e7dfab3cd5a4cf4a","observation_id":"94103a13-4e1b-43a6-bbc2-ed6e9e18a290","resolution":{"observed_at":"2026-08-07T13:12:25.019581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11835","last_updated":"2024-03-18T14:47:03Z","snapshot_observed_at":"2026-07-06T17:46:20.935124Z","submitted_at":"2024-03-18T14:47:03Z","title":"Agent3D-Zero: An Agent for Zero-shot 3D Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11835","snapshot_observed_at":"2026-08-07T13:12:17.411309Z","title":"Agent3d-zero: An agent for zero-shot 3d understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.411309Z"},"links":{"cited_paper":"/paper/2403.11835","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:a0a99cf5c797949fbc52723cb88d647a725a32a0ad63da76fa53759a59b4b6bd","observation_id":"1f8f6e63-38ef-47e1-98da-a0ea5409aeeb","resolution":{"observed_at":"2026-08-07T13:12:17.411309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:24.675578Z","title":"Regionplc: Regional point-language con- trastive learning for open-world 3d scene understanding,","venue":null,"work_id":"30d54873-7d92-4347-b287-0f8be773031e","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.470353Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:c025636ac3103ad75c8252f795a4265c950922f7e058b7a96e9bd6cfb331ef40","observation_id":"1d2c5493-8c26-42f6-90f4-97d8c35ede01","resolution":{"observed_at":"2026-08-07T13:12:24.776061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13631","last_updated":"2023-10-29T14:04:25Z","snapshot_observed_at":"2026-08-05T15:00:57.933479Z","submitted_at":"2023-06-23T17:36:44Z","title":"OpenMask3D: Open-Vocabulary 3D Instance Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13631","snapshot_observed_at":"2026-08-07T13:12:17.523576Z","title":"Openmask3d: Open-vocabulary 3d instance segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.523576Z"},"links":{"cited_paper":"/paper/2306.13631","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:909a753ded8934e64614908fd3f315b9d3d73141bda6d001a4b0f91f3c03b7b5","observation_id":"739b960d-0787-420d-8179-33da110aa4cf","resolution":{"observed_at":"2026-08-07T13:12:17.523576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:24.445774Z","title":"Openins3d: Snap and lookup for 3d open- vocabulary instance segmentation,","venue":null,"work_id":"9cc557e7-a899-47cf-8dbf-ee28a146c3f8","year":2025},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.579259Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:330cc9e294eb76f75647642a5117d5f7550e55cba68235c7b877f58152450886","observation_id":"9fff50e1-dbfb-428b-bd79-ed7ded1e7bfd","resolution":{"observed_at":"2026-08-07T13:12:24.563327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:24.237241Z","title":"Sai3d: Segment any instance in 3d scenes,","venue":null,"work_id":"c3d25aff-4464-49b7-b5cd-245c9f50219f","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.637874Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:b9c056a0ad35e27aad76e2548f0aab74a6bccb361a9a639e25e12a119bbc99df","observation_id":"6b063554-7f08-45ac-8735-ec16104d3204","resolution":{"observed_at":"2026-08-07T13:12:24.321836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:24.028921Z","title":"Lasermix for semi-supervised lidar semantic segmentation,","venue":null,"work_id":"7aa694d2-15d9-412a-8f59-8c10e6930b7c","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.710770Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:708520cf1de49e0961c14ee63871e33876d65ab5cb2276b0c05597a0d1376aad","observation_id":"b8e8a98d-4d75-4d7e-859e-cbf1efa418be","resolution":{"observed_at":"2026-08-07T13:12:24.131536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:23.758611Z","title":"Segment any point cloud sequences by distilling vision foundation models,","venue":null,"work_id":"bc7f56cf-aa8c-4921-bf6f-f2ce49ee5f16","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.807087Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:cacd873301b35b7e26135e59f419a03eaa8279207d1319dd251e75a6023fd74d","observation_id":"88a4132e-37ac-4dc3-aec5-a64dc8004e8f","resolution":{"observed_at":"2026-08-07T13:12:23.906258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:23.562227Z","title":"4d contrastive superflows are dense 3d repre- sentation learners,","venue":null,"work_id":"82ffc7d8-891b-4857-9fb1-603cf6637d2a","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.935512Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:4ddf89f40bd4f1ad8fdfe40c6f86387a83910c963d98aeebca28bef2f66e4ae4","observation_id":"c44806ef-9311-4844-9525-3cd2395c8625","resolution":{"observed_at":"2026-08-07T13:12:23.683419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:23.401474Z","title":"Frnet: Frustum-range networks for scalable lidar segmentation,","venue":null,"work_id":"ecf7f551-b4d8-4d56-8400-28980d5cc7c0","year":2025},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:18.034869Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:ffa02deed34b020fc87489990c15c62b5fc4434f92ae5a2040990718f38134f8","observation_id":"1c3f78e0-9855-4610-a55d-3cdbde6b628c","resolution":{"observed_at":"2026-08-07T13:12:23.484256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-06T11:39:56.281668Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-07T13:12:18.091406Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:18.091406Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:13684a4d1e09dff08aa45b58a0a276d9a19ade599b43505543740dc612684a23","observation_id":"c4b43a23-36bf-481c-ae1a-d60fab1e0d84","resolution":{"observed_at":"2026-08-07T13:12:18.091406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03026","last_updated":"2023-12-05T08:30:27Z","snapshot_observed_at":"2026-07-06T16:57:21.997777Z","submitted_at":"2023-12-05T08:30:27Z","title":"Uni3DL: Unified Model for 3D and Language Understanding","version":1},"cited_work":{"arxiv_id":"2312.03026","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.03026","snapshot_observed_at":"2026-08-07T13:12:20.057520Z","title":"Uni3DL: Unified Model for 3D and Language Understanding","venue":"cs.CV","work_id":"07ca7a2a-eeaa-4f9e-8953-635fd0f545f7","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:18.156553Z"},"links":{"cited_paper":"/paper/2312.03026","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:815f1f0c42bbd073626f798e3ae9ec7304081e4d5e5b42034b1f8d02a26a3f12","observation_id":"b469ac04-b778-4bfe-b0ae-85bc252010b2","resolution":{"observed_at":"2026-08-07T13:12:20.164538Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:23.225567Z","title":"Conceptfusion: Open-set multi- modal 3d mapping,","venue":null,"work_id":"a98616ea-1eec-45d5-893b-9db275fc9750","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:18.254570Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:576c1c646e095241d600b3df97fd4ea35f27a201e74a0d423db1d6c0c14399e8","observation_id":"6171bf57-8155-4ef5-bc3d-97e28edb525c","resolution":{"observed_at":"2026-08-07T13:12:23.283686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-07T21:46:26.659801Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12286","snapshot_observed_at":"2026-08-07T13:12:18.478933Z","title":"Glover: Generalizable open-vocabulary affor- dance reasoning for task-oriented grasping,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:18.478933Z"},"links":{"cited_paper":"/paper/2411.12286","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:49ccffd2a02070ff9f971e80e0251c9d5416b8944577634473165abf89668518","observation_id":"b1e0260d-814e-4607-846a-a2b4f28ac11a","resolution":{"observed_at":"2026-08-07T13:12:18.478933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:23.075189Z","title":"Interactive planning using large language models for partially observable robotic tasks,","venue":null,"work_id":"f6e1d640-750b-452e-a989-200ff863c3df","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:18.706597Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:2b48b415e5302c2b28a164d67dc1a295c1db81d87e6c4922a1d92904baeac749","observation_id":"11fb35db-9415-452a-8a43-1742b926fdb6","resolution":{"observed_at":"2026-08-07T13:12:23.161734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:22.871807Z","title":"3d-llm: Injecting the 3d world into large language models,","venue":null,"work_id":"675bafba-bd61-4c02-b2b8-4ca5ee249126","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:18.817427Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:44af36cb007cf0ff40d62f8c6ad554b265093574259b6c69306cf1b579397da7","observation_id":"fce09665-8e57-4ecf-ac78-7d026fcc53c8","resolution":{"observed_at":"2026-08-07T13:12:22.964761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:22.652958Z","title":"Is your lidar placement optimized for 3d scene understanding?,","venue":null,"work_id":"0fd59884-059c-4673-b467-46edcfb7e950","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:18.907550Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:37bae24201afc3eb95c52dfe2ade43168cb57893d5e26f12c100327167d122e3","observation_id":"5fcd2776-fd95-49b2-b879-6e63ed38e8fd","resolution":{"observed_at":"2026-08-07T13:12:22.736693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:22.475670Z","title":"G3-lq: Marrying hyperbolic alignment with explicit semantic-geometric modeling for 3d visual ground- ing,","venue":null,"work_id":"fb51bc0f-0df5-44a1-89cc-fb11d7ed186b","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:18.980280Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:3e44106bf38455912ef4656d934c15df69377b50f59ea6b59a4677e917786fe6","observation_id":"7343377b-7b76-4d17-b048-d0c15d351101","resolution":{"observed_at":"2026-08-07T13:12:22.557138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:22.214093Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"3dd439a4-d5b9-47f7-bdd1-fa2926692f45","year":2021},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:19.127295Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:8d9bb00d9a522d413cb2551cb37111ae45af8eb82cb9630df87fe9b3316fab9b","observation_id":"3f863d07-94ef-4de9-ad28-d001bf53d84e","resolution":{"observed_at":"2026-08-07T13:12:22.328649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13860","last_updated":"2024-10-17T17:59:55Z","snapshot_observed_at":"2026-07-06T19:35:30.732080Z","submitted_at":"2024-10-17T17:59:55Z","title":"VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13860","snapshot_observed_at":"2026-08-07T13:12:19.231195Z","title":"Vlm-grounder: A vlm agent for zero-shot 3d visual grounding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:19.231195Z"},"links":{"cited_paper":"/paper/2410.13860","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:af7ed8ea4694a10245cd1cf6ee8358e8bad378dfeb56a2a55481e61bc2166e96","observation_id":"edcfabd1-07f9-4cd5-b156-2823a5aa0bc2","resolution":{"observed_at":"2026-08-07T13:12:19.231195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:21.997571Z","title":"Text-guided graph neural networks for referring 3d instance segmentation,","venue":null,"work_id":"c5e9423a-d617-41d7-87fe-b6d5edc15806","year":2021},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:19.353586Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:d5603e429de3a1df25a6dfa0ee636ff5ff123c227b2d8449ac20e852acd8860a","observation_id":"6bb7d6ca-a924-4237-8f5e-d5f833206cbb","resolution":{"observed_at":"2026-08-07T13:12:22.080070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:21.756032Z","title":"Mikasa: Multi-key-anchor & scene- aware transformer for 3d visual grounding,","venue":null,"work_id":"89971deb-0fa1-446c-8f5a-c79a0d30f29a","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:19.499102Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:75beaf4b34f2278a7c82ecb23406226ec487abc48f330754f486f38da536d8e5","observation_id":"4761a55c-7a2e-4aa9-9ef1-8cf0368ce164","resolution":{"observed_at":"2026-08-07T13:12:21.837968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:21.607017Z","title":"Language conditioned spatial relation rea- soning for 3d object grounding,","venue":null,"work_id":"52556197-03e1-4597-b08d-52050948668d","year":2022},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:19.626429Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:1de1248a0b259a997f3466d7aaacd241ab41f6f4f82afbbd61f1157336cc4bdd","observation_id":"0de609bf-af3c-4a3d-b24c-fc6057d60b72","resolution":{"observed_at":"2026-08-07T13:12:21.636127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:21.405272Z","title":"Mask3d: Mask transformer for 3d semantic instance segmentation,","venue":null,"work_id":"7131eaa7-4b07-4dc8-a24c-4ab5d9a6a46a","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:19.747542Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:101b400061b11164a07be1b9dedc8332cd8c1802f55971be1a3df8e8032c137d","observation_id":"b9c59bea-69c3-4075-8a2c-08946499f3a6","resolution":{"observed_at":"2026-08-07T13:12:21.510030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:05:09.758008Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":5,"verified_fuzzy":57},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 1 inbound Pith citation observation for arXiv:2505.22429."}