{"as_of":"2026-07-25T02:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bd87f68aa4d3413c13f02153b24996e7b73c03b1dad815099ecf74f37e90206a","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T22:47:05.747852Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-24T06:31:00.690269+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.25901/citation-record","integrity":"/paper/2605.25901/integrity","json":"/paper/2605.25901/citation-record.json","paper":"/paper/2605.25901"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Gˆ 3-lq: Marrying hyperbolic alignment with explicit semantic-geometric modeling for 3d visual grounding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:22e2783071add3e80fc891b7dc82eaf5413d64c536ec3bd33e4fb3f8fb9027e2","observation_id":"621ec68a-bcc2-4f28-9af0-710e32d3bff8","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Multi-branch collaborative learning network for 3d visual grounding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:a3baa79df7583125783a8e117a56b19145549889004dc408d49e89d045ce4688","observation_id":"c9da0c0c-1e08-4048-a7c0-9b72e9b54f3f","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:38d1158edd75e83ae61160a06b1854f4e44c2337142f786b006a5884e0b7e699","observation_id":"d9ab67e8-a0f2-438c-95ec-1d65b3489d65","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Video-3d llm: Learning position-aware video representation for 3d scene understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:c03e9bc48651d2390334084c0b986185ff0ae6f821aedf47c91fc7782bf4de93","observation_id":"51e219cd-d1ab-4265-add6-d9737eae432b","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Llm-grounder: Open-vocabulary 3d visual grounding with large language model as an agent,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:41ef8ceea49088a63557719f95dcab6149f01b86a6dece84b42804eb0cd7344f","observation_id":"7102f1d4-a20b-4d15-b2d2-ae916c3d3072","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Visual programming for zero-shot open- vocabulary 3d visual grounding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:1f4e4c5ee11b98e051dc8feac03c03cdbde52766c7fc6fb1f492c950586d8a3d","observation_id":"eb61c667-2b73-4a02-8300-b16713cbaef3","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Vlm-grounder: A vlm agent for zero-shot 3d visual grounding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:aa99586dae746abf6417ac514f1a8be1b2608a7277a9baa54eafd0be961b1660","observation_id":"8c1e8d07-ce2a-4b31-83dd-007933d773e5","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"See- ground: See and ground for zero-shot open-vocabulary 3d visual grounding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:a1bc6fded2077c3895b5e57127efcf4583d0baf609aaa60d4fbc91b74d23341e","observation_id":"a94e15b2-98c4-4047-a865-3cd6849ea469","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14594","last_updated":"2025-08-11T11:50:10Z","snapshot_observed_at":"2026-07-06T19:54:05.139608Z","submitted_at":"2024-11-21T21:27:30Z","title":"Solving Zero-Shot 3D Visual Grounding as Constraint Satisfaction Problems","version":2},"cited_work":{"arxiv_id":"2411.14594","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14594","snapshot_observed_at":"2026-07-04T16:39:57.780794Z","title":"arXiv preprint arXiv:2411.14594 (2024)","venue":null,"work_id":"3350769a-3843-4214-a1da-9b4d45e8f602","year":2024},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"cited_paper":"/paper/2411.14594","citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:38cbe9ac7b1e616ed1925f40c74bed470bae1f5cd6f4772cd8d19d646c8f736c","observation_id":"4bd7f0ab-0d5b-43f0-8e52-8c1aa303fa51","resolution":{"observed_at":"2026-06-29T22:54:01.240702Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Sort3d: Spatial object-centric rea- soning toolbox for zero-shot 3d grounding using large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:e69c52ad93dd6737bd868fe2af6bf84ccd1ecbf162efaa736dc534fcf26cb9db","observation_id":"bd0b770d-1351-4f08-998d-733a7bf42cf4","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Transcrib3d: 3d referring expression resolution through large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:a8e0d7b363b5c759d45d49432475f4a7d8216fd4b01d7891936e94b9a6746e00","observation_id":"5abcaaca-cd13-4feb-9078-2603b60edad4","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural lan- guage,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:f4100c5c81d7368479edf53d2ddf8a42f31f998eeb945d4017525eb60f590b13","observation_id":"1a07273b-3ba3-4af3-ad29-674b8084aa9e","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Referit3d: Neural listeners for fine- grained 3d object identification in real-world scenes,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:61e53aef335967011050d4b8dfc9ee4d746f51f0f3e187ca8819a9ae6d7041b5","observation_id":"ba5ea7fa-6a64-4c12-84f1-d9db03d5b78c","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Four ways to improve verbo-visual fusion for dense 3d visual grounding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:a481509d5d198b88d3548fbbcc9e7aa5ce9e798b878af382e81f1529f07dd54b","observation_id":"38b20b93-1502-4d02-b450-39428e94ab7e","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13631","last_updated":"2023-10-29T14:04:25Z","snapshot_observed_at":"2026-07-06T15:46:02.349293Z","submitted_at":"2023-06-23T17:36:44Z","title":"OpenMask3D: Open-Vocabulary 3D Instance Segmentation","version":2},"cited_work":{"arxiv_id":"2306.13631","doi":"10.48550/arxiv.2306.13631","metadata_source":"pith","pith_arxiv_id":"2306.13631","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Openmask3d: Open-vocabulary 3d instance segmenta- tion","venue":"cs.CV","work_id":"6da1306f-2713-48ed-a50f-29b66d9a2250","year":2023},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"cited_paper":"/paper/2306.13631","citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:2fc6f9fcb79cc813c2626764dea18a5f429bb40b61f42e543d591f47095da3ee","observation_id":"bb040efe-7a4b-43af-80fa-113c0f2b131c","resolution":{"observed_at":"2026-06-29T22:54:01.231727Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Isbnet: A 3d point cloud instance segmentation network with instance-aware sampling and box-aware dynamic con- volution,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:e4501e68b3e9916a82aa7b241de1a7d1c1b9de6c442bd38e0a403cd426be6b32","observation_id":"0ff0fb14-1a73-44f0-b6cc-89ca21138747","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03908","last_updated":"2023-06-06T17:59:51Z","snapshot_observed_at":"2026-07-06T15:39:22.864048Z","submitted_at":"2023-06-06T17:59:51Z","title":"SAM3D: Segment Anything in 3D Scenes","version":1},"cited_work":{"arxiv_id":"2306.03908","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03908","snapshot_observed_at":"2026-07-04T20:00:07.715806Z","title":"Sam3d: Segment anything in 3d scenes","venue":null,"work_id":"0fce1f54-3699-443e-b6d6-ebe0674ea983","year":2023},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"cited_paper":"/paper/2306.03908","citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:7e516ab6b2fbf38685e9c02f3f98c230ca49f4990b585c31348b5a1bff85bfe6","observation_id":"45358fbe-78bc-4736-8fc6-78d01825bd88","resolution":{"observed_at":"2026-06-29T22:54:01.237749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Open3dis: Open-vocabulary 3d instance segmentation with 2d mask guidance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:45bf49d5664c6757d888ae18bd7c7f1863cb86805fd45337390ea9b294d34781","observation_id":"cf86a4f2-e806-457b-9169-53279f855ad0","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Any3dis: Class-agnostic 3d instance segmentation by 2d mask tracking,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:11a4b717c5f6699ec289a2ace033038aac79381da34205523277128565a877d6","observation_id":"49e580fe-5d5b-4830-9e83-65bb7bb6026e","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Conceptgraphs: Open-vocabulary 3d scene graphs for perception and planning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:99b249fcf6e94b6b241c806b8f0ce740eeacd40d6f39cc78de1d04587cb79015","observation_id":"4e1d08be-0b11-4443-b714-081085a2e5dc","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07241","last_updated":"2023-10-23T14:56:15Z","snapshot_observed_at":"2026-07-06T14:51:48.920020Z","submitted_at":"2023-02-14T18:40:26Z","title":"ConceptFusion: Open-set Multimodal 3D Mapping","version":3},"cited_work":{"arxiv_id":"2302.07241","doi":"10.48550/arxiv.2302.07241","metadata_source":"arxiv_reference","pith_arxiv_id":"2302.07241","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Conceptfusion: Open-set multimodal 3d mapping","venue":null,"work_id":"9190d1f8-03e9-478a-80a1-8d74bcec4ce9","year":2023},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"cited_paper":"/paper/2302.07241","citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:650a78c34299ef37ad0004053fa32b2e036d3d0fec5d2beb78a90f543a9aa7bb","observation_id":"e75f00bd-bd61-424d-a91c-acb2c5eb3f5f","resolution":{"observed_at":"2026-06-29T22:54:01.246558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Phygrasp: Generalizing robotic grasp- ing with physics-informed large multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:5c68e43dc47741a4bda0da7c9f12fa0fe38acd05fd267cc17d0c7f986302e9ea","observation_id":"331a537f-d8b2-4772-becc-1fca06193087","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Zero-shot object navigation with vision-language models reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:027caad85bc86b328061ec2465ed9bf75cbaf9893ad2f32e3b992176e60615e4","observation_id":"af2ec1cf-a924-498c-8813-9c69a17fe1e3","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Iref-vla: A benchmark for interactive referen- tial grounding with imperfect language in 3d scenes,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:12f2365d3df4c7d0449ccc5912576bc0b5e67860dbfa47df98e4e6b5104a3f4e","observation_id":"3ec2d34f-b841-446d-87f2-776521f3067b","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Sceneverse: Scaling 3d vision-language learning for grounded scene understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:82818bb64d36899da17a9658b67ddf86f8935e2a482c923c3f5240367d751a37","observation_id":"561bfa1f-4a12-4808-94b8-b6571e253da6","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Mask3d: Mask transformer for 3d semantic instance segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:6eebc6474463af1e2c11129f320a46dfdf3297ebe5de99c135385009f56429a9","observation_id":"5bf9c083-32d1-4bf2-bb20-047d1d535f0c","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:dc21fa9f315479bf207f3807deadd8fd26522977e97a89897efaf5abf814109c","observation_id":"f01fbfbe-c7a8-4faf-8764-197323671bb7","resolution":{"observed_at":"2026-06-29T22:54:01.243392Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Using ollama,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:56e07b1e372efece1470c89e0a115d2a7e929d03bbdbe101280f88a4797265a7","observation_id":"0c0e2192-34ab-4268-bdf8-e0225399c842","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Chase,Langchain,https : / / github","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:7e7cfe851b53202570b24cb45473a9e234f9c1b2d9aeec6556d62d6134882960","observation_id":"aa9cb1c7-2d56-470b-80c0-b7049d59ccc1","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-07-06T20:15:54.645357Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"cited_work":{"arxiv_id":"2501.01428","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.01428","snapshot_observed_at":"2026-07-08T02:44:27.702116Z","title":"Gpt4scene: Understand 3d scenes from videos with vision-language models","venue":"cs.CV","work_id":"1b0a4b52-5390-4922-abed-d044b52ad3bb","year":2025},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"cited_paper":"/paper/2501.01428","citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:337a95f154d06e4abb081dd621e5879153a10da07a9b4f4438c476e14efe327f","observation_id":"10454cfd-1cdb-4d81-94e9-768de310711f","resolution":{"observed_at":"2026-06-29T22:54:01.235024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Mikasa: Multi-key-anchor & scene-aware trans- former for 3d visual grounding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:725b00e1d746a856646e1ae165a3b2f520446fb93d4ee753eb55111a41c7e011","observation_id":"27652e4b-f858-40ac-886e-d13de3c027a6","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:47:05.747852Z","title":"Language conditioned spatial relation rea- soning for 3d object grounding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T22:47:05.747852Z"},"links":{"citing_paper":"/paper/2605.25901"},"observation_digest":"sha256:648ecd556ba8d0fe25ce1fce14fdaec089435dad48c8f28d27e2f51429bcf4fe","observation_id":"ab0266f1-8843-4483-994b-352c5dcba901","resolution":{"observed_at":"2026-06-29T22:47:05.747852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.25901","last_updated":"2026-05-25T14:29:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:29:04Z","title":"AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":26,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"thesis":"As of 25 July 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2605.25901."}