{"as_of":"2026-08-19T05:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:411693e5c31b92098524db083da36a202aa6fea9f4a25242e2e93fcbea4a1c35","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:45:36.878751Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:03:03.534576Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T02:44:27.709058Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18450","snapshot_observed_at":"2026-08-06T18:03:03.534576Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-15T18:44:58.192236Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.534576Z"},"links":{"cited_paper":"/paper/2412.18450","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:498ed89508774472b6a88547f7460b53e40030f2465e60bc9772edd4b95e52d9","observation_id":"1643fde7-2768-4b46-bc1c-8a6a60bbdb1c","resolution":{"observed_at":"2026-08-06T18:03:03.534576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18450","snapshot_observed_at":"2026-08-06T16:58:55.429664Z","title":"3DGraphLLM: Combining Semantic Graphs and LargeLanguageModelsfor3DSceneUnderstanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12123","last_updated":"2025-07-16T10:47:12Z","snapshot_observed_at":"2026-08-13T22:00:07.646827Z","submitted_at":"2025-07-16T10:47:12Z","title":"Open-Vocabulary Indoor Object Grounding with 3D Hierarchical Scene Graph","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:58:55.429664Z"},"links":{"cited_paper":"/paper/2412.18450","citing_paper":"/paper/2507.12123"},"observation_digest":"sha256:dd3710ff40ebeb1dce688b3d500cb2bde3cbd36540fcd1cb1e058b0f37718e15","observation_id":"c41d5265-a4aa-419d-ac1c-ac304ad5bd08","resolution":{"observed_at":"2026-08-06T16:58:55.429664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"cited_work":{"arxiv_id":"2412.18450","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.18450","snapshot_observed_at":"2026-07-08T02:44:27.709058Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","venue":"cs.CV","work_id":"e9ae01fd-fe0d-4402-90ee-184984110204","year":2024},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-07-16T23:18:47.677814Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-08T02:44:00.608590Z"},"links":{"cited_paper":"/paper/2412.18450","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:3a8433df9faabcbb8d2d09ffb49b8f69600c21f03498ee364de97c70b9b4a390","observation_id":"90527ecd-ee03-4b6f-b4cb-db007e119ec8","resolution":{"observed_at":"2026-07-08T02:44:27.710353Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18450","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"3dgraphllm: Combining semantic graphs and large language models for 3d scene understanding.arXiv preprint arXiv:2412.18450, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-07-16T23:18:47.677814Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2412.18450","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:9467ea8b5810bfd71631260e17f076c58fe3dc7756938b3e2e7772d02a4da5c7","observation_id":"e1b60801-1547-4a74-9c20-7ce8b66a2a9a","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.18450/citation-record","integrity":"/paper/2412.18450/integrity","json":"/paper/2412.18450/citation-record.json","paper":"/paper/2412.18450"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.838721Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":"a95c0999-48b2-4d21-a5ef-0f410a92ead3","year":2020},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.577857Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:1d8da79ba0e736d14d5fcef94d5a6d03cd6dd7bd285886d64464ff3483ee3956","observation_id":"c14a5eb6-2e6e-423c-b53f-6a4424b974b4","resolution":{"observed_at":"2026-08-11T04:45:37.843273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.825501Z","title":"Llama 3 model card","venue":null,"work_id":"59262bde-7b8e-4995-bf94-1e135fba27d8","year":2024},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.582994Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:e51279686b0eb8344f847bc48a3c48a084d00bacc556f6958f1dd90d8ce0da8e","observation_id":"92accb02-a146-47fc-b5f6-93451e558c9b","resolution":{"observed_at":"2026-08-11T04:45:37.829855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.812358Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"acf0a231-6a03-4acb-817e-e9fbc8c61885","year":2022},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.587914Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:fa5be033ca5c2383ce518d80ed6fba659b3be8f44843f89ff70df53728e8aaef","observation_id":"4ef2d1c2-ceb2-45d4-abd0-24ab5ed737c1","resolution":{"observed_at":"2026-08-11T04:45:37.816352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15940","last_updated":"2023-09-27T18:32:29Z","snapshot_observed_at":"2026-08-16T14:57:05.507975Z","submitted_at":"2023-09-27T18:32:29Z","title":"Context-Aware Entity Grounding with Open-Vocabulary 3D Scene Graphs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15940","snapshot_observed_at":"2026-08-11T04:45:36.592429Z","title":"Context-aware entity grounding with open-vocabulary 3d scene graphs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.592429Z"},"links":{"cited_paper":"/paper/2309.15940","citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:16117cd5d0a6192d77cdf9a7a234af08cc730a38d01ad93b22b6e00bae37d307","observation_id":"4536cdb4-728c-4ade-a01f-ca6637ae1a73","resolution":{"observed_at":"2026-08-11T04:45:36.592429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.799894Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":"150d009f-3ed6-4c87-8562-4fb6cdffd70c","year":2020},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.597235Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:53043bd617bb51569ab82c1528ceb49945c56d9afbc85620607a9b8b52fa4081","observation_id":"e623daae-4cee-4c53-af84-9f1014d6bff9","resolution":{"observed_at":"2026-08-11T04:45:37.803874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:36.601647Z","title":"Language conditioned spatial relation reasoning for 3d object grounding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.601647Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:01ca959a38285127b836cde1650ad24862d9e0d0d10e5c744601938c93f11c90","observation_id":"ee817833-0af0-402b-88fc-ea50081a12eb","resolution":{"observed_at":"2026-08-11T04:45:36.601647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.777841Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understand- ing, reasoning, and planning, 2023","venue":null,"work_id":"e6253941-8150-45c8-93d2-1977473bc1cd","year":2023},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.606140Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:30bc414a0abedff9665a83b9e7f980badd6b3e0f7d6c8412afb844a9cbda23ae","observation_id":"dee1d8d7-06a0-4d5d-8794-763c0a600069","resolution":{"observed_at":"2026-08-11T04:45:37.782267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-18T13:34:10.935081Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-11T04:45:36.610992Z","title":"Grounded 3d-llm with referent tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.610992Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:ed6d12def5c07fe33e98e578584260ec959f7bd5b13715d6710bd119baccd0c1","observation_id":"1fc2a2b5-351d-4e0c-ab64-70138ae7537b","resolution":{"observed_at":"2026-08-11T04:45:36.610992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.764081Z","title":"Scan2cap: Context-aware dense captioning in rgb- d scans","venue":null,"work_id":"a40317c2-b6d1-4eed-a2df-02b30964cb15","year":null},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.615751Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:c016ffaf6ceac56455b4d354d3378d97beba45c843adbd67d73e70953f64326a","observation_id":"52fbef19-02fa-4dc4-b773-29ff12916935","resolution":{"observed_at":"2026-08-11T04:45:37.768952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-08-16T13:46:36.421633Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-11T04:45:36.620135Z","title":"Spatial- rgpt: Grounded spatial reasoning in vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.620135Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:070436bc717708228cc52984b56d15f259c1e544f4b4594dbd1e189883d30982","observation_id":"130f8898-d5e3-45b6-ab5c-43f72c5e6c5d","resolution":{"observed_at":"2026-08-11T04:45:36.620135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.750204Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":"8f92c0e2-e36b-4ad1-8b85-c61105a1bf53","year":2017},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.624729Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:c832c0292c3a9a0a0a7abb044b9bb9f92fe9f5f0c94f114046d16936560e6c76","observation_id":"c2ffb367-7fb2-440f-a513-480ac499bf1d","resolution":{"observed_at":"2026-08-11T04:45:37.754821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02329","last_updated":"2023-06-04T11:08:53Z","snapshot_observed_at":"2026-08-16T15:26:48.033888Z","submitted_at":"2023-06-04T11:08:53Z","title":"Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02329","snapshot_observed_at":"2026-08-11T04:45:36.628677Z","title":"Multi-clip: Contrastive vision-language pre-training for question answering tasks in 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.628677Z"},"links":{"cited_paper":"/paper/2306.02329","citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:5ef7997780e55c2633fd3ed81831ee511ef8aa7eaa5e54301ce7e65925ae1892","observation_id":"31f07439-f6bb-463c-9afc-7355d1654b23","resolution":{"observed_at":"2026-08-11T04:45:36.628677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.736708Z","title":"Scenegenie: Scene graph guided diffusion models for image synthesis","venue":null,"work_id":"56f7e413-c44e-4ea0-8d2a-d22abbcd065f","year":2023},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.633034Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:fb4caf540c36188a325c887a9b6e0990e3a7027b4a99289451838efb5021bc6e","observation_id":"cd736c78-a91e-425b-975f-a3f6dba0b57b","resolution":{"observed_at":"2026-08-11T04:45:37.741294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.722587Z","title":"Free-form description guided 3d visual graph network for object grounding in point cloud","venue":null,"work_id":"ddbb36d7-cd03-4285-ae07-0dd77f1bc3d0","year":2021},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.637244Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:dff684bbca1fa7fc4c8729ae4f533b683c4b7eebd89c579ca58005cdc123baf2","observation_id":"0e0b409f-76a3-40f0-ba2e-2720cb107490","resolution":{"observed_at":"2026-08-11T04:45:37.727323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-17T15:42:36.096154Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-11T04:45:36.641435Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.641435Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:5b9c3b2ebc88d39f030783f5566a5aed96e4eb73628d0d34403fdbe9327564c2","observation_id":"e872f5b6-d329-44dc-ae47-8d18063d0b4b","resolution":{"observed_at":"2026-08-11T04:45:36.641435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.708895Z","title":"Graphdreamer: Compositional 3d scene synthesis from scene graphs","venue":null,"work_id":"22b63898-a937-4ddb-872e-8a5cdb8df333","year":2024},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.645986Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:0419fc43839c074a05df3be07654f12cf36275ff16bb2b634159c4ae92f21f9c","observation_id":"6d375d1d-1849-4e2d-bfba-e580f8c1f25b","resolution":{"observed_at":"2026-08-11T04:45:37.713483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.695309Z","title":"Concept- graphs: Open-vocabulary 3d scene graphs for perception and planning","venue":null,"work_id":"7d29caa8-68bb-46e3-a9df-c72c6162f173","year":2024},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.650175Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:7197102ffc49ee9c9bb7eabcf9ec3e1c42c0bac940fae5b022aee4fe947460bd","observation_id":"b9ed464a-dfc1-423c-bf2a-e3dc9e8ed2d1","resolution":{"observed_at":"2026-08-11T04:45:37.699563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.682274Z","title":"Zero-shot referring expression comprehension via structural similarity between images and captions","venue":null,"work_id":"76ddaaf2-d871-405b-a54b-53e1a51b4c46","year":2024},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.654127Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:43490a5486b3d33a0de535fe35eade82eb6e52512f0604467adb2433e2dd05a0","observation_id":"27a13b60-6c6f-4c4f-9870-29305ff5049f","resolution":{"observed_at":"2026-08-11T04:45:37.686646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.669119Z","title":"Relation-wise transformer network and reinforcement learning for visual navigation","venue":null,"work_id":"c7596c9e-cd5c-47ba-a325-5a1145aa93d6","year":2024},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.658428Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:1d9ddd8f6a65cf9c953d9db8e77b13e39d0e4533576095e3a8c7d575299a2863","observation_id":"cc95ae88-526f-4c96-b434-d3b00e95b536","resolution":{"observed_at":"2026-08-11T04:45:37.673483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.655419Z","title":"Language-grounded dy- namic scene graphs for interactive object search with mobile manipulation","venue":null,"work_id":"7f2de858-f7e9-4dfd-8ea6-60a00125a410","year":2024},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.662617Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:267d80cf20b5b6641e863791fdb3bf14f24639ac8eb7a62330b7a44b927f3657","observation_id":"d30d82ac-0ae9-41f6-b2fd-4152fd3a691b","resolution":{"observed_at":"2026-08-11T04:45:37.659802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.639838Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":"ad7a803f-daae-472d-9471-b4277ab376fc","year":2023},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.666931Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:f454370c31550221e4ab598001b82b79468db56253df60bef28d38b1a7b46bcd","observation_id":"7f8c743e-8e18-49a9-a5be-c0849b5cd608","resolution":{"observed_at":"2026-08-11T04:45:37.645097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.624463Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":"b2c472c4-cfd9-4e2a-aae5-834cc21ab665","year":2023},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.671068Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:ea9fd2a444d151ab1831c63810fa9cb6cb65976241fe1786769e8474c3d801d0","observation_id":"683404d7-ed7d-4dac-adf6-8fb0919792a6","resolution":{"observed_at":"2026-08-11T04:45:37.629183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T04:45:36.674813Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.674813Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:7ef0ed65da1bbda58fdf81b6ae67c3903d58e1396227ad0a6af2acd7031b863e","observation_id":"3d24ba0b-1302-4aee-9580-15a9882cb22d","resolution":{"observed_at":"2026-08-11T04:45:36.674813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-19T04:55:44.810836Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-11T04:45:36.679239Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.679239Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:287d40a0f51265a5cdbb82a616fad83cc27194c2f1a515a342dec36c8742e691","observation_id":"f4b82864-43c3-4d00-96bb-a77d840c7f12","resolution":{"observed_at":"2026-08-11T04:45:36.679239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.609635Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":"384edd6c-b663-4b98-9c13-b2c260195180","year":2024},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.683973Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:6c0a87ea1e1c0bccd5a98305f5610f422134496d20a8887aad11ffe64331ddfc","observation_id":"0ba9728e-20fa-4e72-b32f-7596ebab974a","resolution":{"observed_at":"2026-08-11T04:45:37.614451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-11T04:45:36.688266Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.688266Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:42416c1158d5b051e91ae40a823de881dfb3608ecc890c36a8a592690acf0f32","observation_id":"f417d8c4-095d-4ab4-8d5f-ecf7b5c5befb","resolution":{"observed_at":"2026-08-11T04:45:36.688266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.595048Z","title":"Multi- view transformer for 3d visual grounding","venue":null,"work_id":"f5e69367-1f6e-4e29-87f6-24f9a5675783","year":2022},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.693229Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:3dc77de39fb040b195e0daeb47cdaa55a10b0f4c00b105c38d59b6a29188feed","observation_id":"072329a4-5f28-4ef5-ba33-b29385f59046","resolution":{"observed_at":"2026-08-11T04:45:37.599564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.580939Z","title":"Bottom up top down detection transform- ers for language grounding in images and point clouds","venue":null,"work_id":"193a2359-3b68-4c38-991a-73b51f68d6b2","year":2022},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.697585Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:a1088d7abae1073be9354508022c850ea624386fdd0692846f4e29d522ad10e3","observation_id":"a0d10e22-e6cf-43a8-95a6-83dc76dd5eb0","resolution":{"observed_at":"2026-08-11T04:45:37.585779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.566571Z","title":"Image retrieval using scene graphs","venue":null,"work_id":"585b74a5-7219-40de-81d5-4c3c999233f7","year":2015},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.702005Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:23147537e8a1a176e09634209df153b5eafe76123b3772bac0c5d169e1811928","observation_id":"34fe9717-9ee8-4306-a0a0-e047c4eff3c5","resolution":{"observed_at":"2026-08-11T04:45:37.571241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:36.706163Z","title":"Image gener- ation from scene graphs","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.706163Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:1965379acdaab895f4212df08c801d1e8c4e9f2415f99d342046239639c61c92","observation_id":"3f473dbc-af2f-4174-9da4-4f3c3a33b941","resolution":{"observed_at":"2026-08-11T04:45:36.706163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.542791Z","title":"Robin3d: Improving 3d large language model via robust instruction tuning, 2025","venue":null,"work_id":"c2863132-7d9e-4f2b-9559-d3c5720e9be7","year":2025},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.710292Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:76d19e5c44cb30ba8bef3730f5ba156961ba4d86aedbcc44346f952c72324795","observation_id":"db1e78bc-60c0-448a-b6a0-59431af02a88","resolution":{"observed_at":"2026-08-11T04:45:37.547417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.529017Z","title":"Open3dsg: Open-vocabulary 3d scene graphs from point clouds with queryable objects and open-set relationships","venue":null,"work_id":"ced2e593-6164-498f-906b-0526e51889d3","year":2024},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.714517Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:ed5c54705c481c094cf9d1a70b4380b4caf9dc560d5d5022f84d74e8bc37197c","observation_id":"be38b31b-7f5f-4bbb-ade6-951e2a89db15","resolution":{"observed_at":"2026-08-11T04:45:37.533147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.515419Z","title":"Oneformer3d: One transformer for unified point cloud segmentation","venue":null,"work_id":"cf92e82e-9bff-40c8-aa6d-e01a0506372c","year":2024},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.718783Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:d51313a5a1a5b8f81ce1eeb6fe490b6a1bee63512d8b4fccb4e5ddf8ba05a268","observation_id":"04df037a-6cf5-4664-85c8-49ae819d6e32","resolution":{"observed_at":"2026-08-11T04:45:37.519774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07113","last_updated":"2025-05-06T14:02:10Z","snapshot_observed_at":"2026-08-16T13:44:14.661118Z","submitted_at":"2024-06-11T09:57:04Z","title":"Beyond Bare Queries: Open-Vocabulary Object Grounding with 3D Scene Graph","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07113","snapshot_observed_at":"2026-08-11T04:45:36.723239Z","title":"Beyond bare queries: Open- vocabulary object retrieval with 3d scene graph","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.723239Z"},"links":{"cited_paper":"/paper/2406.07113","citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:5f58d8b7557caeef1051a671e19bce69a743763a2e19bc493da6c501ed7f132a","observation_id":"acc2e32b-094a-469e-bcd8-4b3f53ae7ba3","resolution":{"observed_at":"2026-08-11T04:45:36.723239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-11T04:45:36.728239Z","title":"Sqa3d: Sit- uated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.728239Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:c29bc59dfff2fa6f7081a6359f40066189f612d155f9f8660578d8b1e59231b4","observation_id":"e8c46256-0ae8-43b0-aca2-222628685921","resolution":{"observed_at":"2026-08-11T04:45:36.728239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.501905Z","title":"Cross3dvg: Cross-dataset 3d visual grounding on different rgb-d scans","venue":null,"work_id":"15c6d5be-f842-420e-b9ec-3a35524ca3fe","year":2024},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.733025Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:0245343ea14bf81df6c242fa60249a688e3392513615388720474bf4b188f608","observation_id":"877911a5-7369-479e-ad5d-484e8bed3566","resolution":{"observed_at":"2026-08-11T04:45:37.506206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-11T04:45:36.737469Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.737469Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:f4263f0cc4b7f8655f8ca6ca2990db45d7237e2f08e0f104d9db57af9f05e1f3","observation_id":"ee896eaf-2925-48a2-a7c1-ca8be62be0a7","resolution":{"observed_at":"2026-08-11T04:45:36.737469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.488499Z","title":"Labrad-or: lightweight memory scene graphs for accurate bimodal reasoning in dynamic operating rooms","venue":null,"work_id":"f7e23309-7c29-4aca-a209-e91103fd81a0","year":2023},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.742117Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:32dc9db0d44af2ae6106afcf103c5f988ec9858b4ad33458fdab8e786bfe69bc","observation_id":"9dd83c12-ffc4-41b8-9aba-b5a45b6e9ab9","resolution":{"observed_at":"2026-08-11T04:45:37.492689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:36.746409Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.746409Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:cda4be655d650a2596c9a281aa59b33e60984e8fe49660d69ac0977a74cbe3c9","observation_id":"18a342d1-191c-4c5a-a01d-f027f3322237","resolution":{"observed_at":"2026-08-11T04:45:36.746409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.466903Z","title":"Scene graph semantic inference for im- age and text matching","venue":null,"work_id":"3feaf965-e722-40c0-bac7-cc3f5ced5f69","year":null},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.751035Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:d89856e00811a5245183ae917a749ab04970174c87ce96b10427fd6dd48b1031","observation_id":"2f44d453-47cf-4529-8a1a-b5ec5817fd12","resolution":{"observed_at":"2026-08-11T04:45:37.471274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.453654Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":"20facf9c-ce42-4069-b6f4-e7b673ab601d","year":2023},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.755073Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:b0816aa3f23ab6dbf403f77e2235bfec93cdfe28c35e0a53849cd7c907c795be","observation_id":"55649b9a-ee5c-4018-b571-68d2956c1c9e","resolution":{"observed_at":"2026-08-11T04:45:37.457886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.439273Z","title":"An approach to generate a caption for an image collection using scene graph generation","venue":null,"work_id":"9a1d4e55-463d-46f2-b9b5-6fd8025fc031","year":2023},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.759071Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:3eae9b2241816cd402f0fa036929716ca0f8da0f8561bbf340c4b5061a62febd","observation_id":"f891c3c1-02b5-43f4-8209-a10fbcddb0ae","resolution":{"observed_at":"2026-08-11T04:45:37.443988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-08-15T04:16:11.827389Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01428","snapshot_observed_at":"2026-08-11T04:45:36.763185Z","title":"Gpt4scene: Understand 3d scenes from videos with vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.763185Z"},"links":{"cited_paper":"/paper/2501.01428","citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:54acfddbdf29b459e6966db1e8f852024c76e6ce7ea2cec94639c2f9ca184bd6","observation_id":"c0790fbe-6440-46f1-af69-0cda72d1d248","resolution":{"observed_at":"2026-08-11T04:45:36.763185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:36.767234Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.767234Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:617c70ce01cde81a74a696b0b6286628a7e3e1014078e52b2f160a13f07e5a9e","observation_id":"d626c59c-7351-46e8-8028-3163af013edc","resolution":{"observed_at":"2026-08-11T04:45:36.767234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.416709Z","title":"Kimera: From slam to spatial perception with 3d dynamic scene graphs","venue":null,"work_id":"7ce90388-7082-4247-8d6e-17a823a9ad56","year":2021},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.771048Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:ef769f311618e12dc949092720c23909562bf15cd59f34621bb46ec4b1ffddba","observation_id":"16fe8780-03fa-4445-856e-ee3ba5b7a48e","resolution":{"observed_at":"2026-08-11T04:45:37.421400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.402813Z","title":"Mask3d: Mask trans- former for 3d semantic instance segmentation","venue":null,"work_id":"45820416-64f6-4112-9fc7-f1ceb4be60db","year":2023},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.774692Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:6b902833694c08819a2f74108fde75ed87a4a895fd2801bb31c89d9d1605515f","observation_id":"c544644e-c0e6-452d-afa3-5c06d998c2b3","resolution":{"observed_at":"2026-08-11T04:45:37.407337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.388069Z","title":"Open- vocabulary object detection via scene graph discovery","venue":null,"work_id":"1becfbc2-3cd4-4d94-9c39-b4be622e7d92","year":2023},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.778238Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:d55df1eb64c956d274b9250937038f7919b837ce256b25ccb6d26d065d17d074","observation_id":"c60d792d-20c3-4b22-8297-6199b8d91547","resolution":{"observed_at":"2026-08-11T04:45:37.392943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:36.782000Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.782000Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:7f16b52c5b280e5b666b0590841468aee0a1fa3d1ce76542e8e0ce850cb4078f","observation_id":"bab9a9a3-8f8d-42bd-a350-db5f713a2d5c","resolution":{"observed_at":"2026-08-11T04:45:36.782000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.365484Z","title":"Cider: Consensus-based image description evalu- ation","venue":null,"work_id":"41dbb9bf-b314-492c-a5f1-4c559e9ea773","year":2015},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.785773Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:81bc065ee545af1c48f404622e5855621da6bd265893d029bf7e386398b3ae93","observation_id":"ffb34d65-30b7-4d95-a48a-9965967fcc3d","resolution":{"observed_at":"2026-08-11T04:45:37.369921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.351177Z","title":"Rio: 3d object instance re-localization in changing indoor environments","venue":null,"work_id":"fa76e818-bf17-4eb2-baf3-e40e7d07cc0e","year":2019},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.790000Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:ac1405357feda1d1098ac41c7df10b4b84d0ddb254a5d7cdf201564768b1ec7e","observation_id":"5c7f83f5-633e-474c-8fa8-61a05f0c7ba8","resolution":{"observed_at":"2026-08-11T04:45:37.355930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04334","last_updated":"2024-01-09T03:22:16Z","snapshot_observed_at":"2026-08-16T14:28:56.092933Z","submitted_at":"2024-01-09T03:22:16Z","title":"Large Language Models for Robotics: Opportunities, Challenges, and Perspectives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04334","snapshot_observed_at":"2026-08-11T04:45:36.794731Z","title":"Large language models for robotics: Opportunities, chal- lenges, and perspectives","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.794731Z"},"links":{"cited_paper":"/paper/2401.04334","citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:996c12fb67154e00a62137f805c576161df0ee8ea430c1f5929c7601bf83589a","observation_id":"56fe7fc2-60b4-4e55-84f9-aab1752f577e","resolution":{"observed_at":"2026-08-11T04:45:36.794731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.337200Z","title":"Vl-sat: Visual-linguistic semantics assisted training for 3d semantic scene graph prediction in point cloud","venue":null,"work_id":"4735d5f0-4ee9-4ed1-9597-b1068e532276","year":null},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.800059Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:e7dfa0478dac964efc426654a4f1d3bff73fe949df56c174f7a2cda8374f286e","observation_id":"0725f1b8-8e72-4712-be62-c1dd4580d18b","resolution":{"observed_at":"2026-08-11T04:45:37.342042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.323750Z","title":"Hierarchical open- vocabulary 3d scene graphs for language-grounded robot nav- igation","venue":null,"work_id":"3c9b5d7d-7ac4-45f7-8392-09b76545e9ec","year":2024},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.804220Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:fe9abc4fcdd1b5ed3f7150896daf63c79472f058c7573bcfb7369efa858350da","observation_id":"bbd69f3e-4ae5-4171-a163-a936f9f7b235","resolution":{"observed_at":"2026-08-11T04:45:37.328152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.311306Z","title":"3d question answering with scene graph reasoning","venue":null,"work_id":"4fb67fea-014c-4adc-b42c-8668c88b794c","year":2024},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.808122Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:5c872cdc806d27c51af09e0eece6c40e2673e98205cd8f8051792516a0b50058","observation_id":"3e924966-e3d2-48c9-aa70-0cb2222d95e3","resolution":{"observed_at":"2026-08-11T04:45:37.315282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.298798Z","title":"Llm- grounder: Open-vocabulary 3d visual grounding with large language model as an agent","venue":null,"work_id":"f0aa7bc0-1443-47f6-849e-81b3b278c1cc","year":2024},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.812085Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:b00ca5b6e331fdebac187a98f7461d8627e916c9d479ef22283d7094addd9982","observation_id":"fc58e3e7-8e70-4514-a832-84203c3ccfdf","resolution":{"observed_at":"2026-08-11T04:45:37.303029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.286314Z","title":"Cross-modal rela- tionship inference for grounding referring expressions","venue":null,"work_id":"16feac7b-57d0-4563-8153-0bde50eb5e76","year":2019},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.815993Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:689117414afbc5ad47d9ad3a7e1cdcde6ccc06dd584822fb1747a13e51d8f5c7","observation_id":"223a03b8-d225-477f-a412-489bc62915c9","resolution":{"observed_at":"2026-08-11T04:45:37.290269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.273871Z","title":"Auto-encoding scene graphs for image captioning","venue":null,"work_id":"b19812bd-c242-460c-a110-7c891b726aaf","year":2019},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.820336Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:538b934da59e6155057d7219a5ea956cf9fa647ef8c7fab2df413c18dbc36c86","observation_id":"30f473b7-5ed4-4462-97a0-81ccd005bb35","resolution":{"observed_at":"2026-08-11T04:45:37.278068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.261025Z","title":"Visual programming for zero- shot open-vocabulary 3d visual grounding","venue":null,"work_id":"54df6bc3-1999-43bd-bbc5-b2743bb64d35","year":2024},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.824633Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:149eae89ea7848efee5dcc11c97e1d245175b01c57fc8b7645a7d8c12049f77a","observation_id":"f4665fc8-bf02-4b2b-ad39-59142f7493da","resolution":{"observed_at":"2026-08-11T04:45:37.265623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.247288Z","title":"Com- monscenes: Generating commonsense 3d indoor scenes with scene graphs","venue":null,"work_id":"be56ad69-fe78-4037-b390-958f2871b49f","year":2024},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.829781Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:f8fa0ed16f3a7b54bb43c92402bfe8bee6524f4ab85265ece9e90b01c8d092ac","observation_id":"6b3a8ab3-60e3-40cf-b94e-301eaf70014d","resolution":{"observed_at":"2026-08-11T04:45:37.251944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.233282Z","title":"Multi3drefer: Grounding text description to multiple 3d ob- jects","venue":null,"work_id":"58853d19-60c8-4cc5-90a8-28297a4440a9","year":2023},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.834111Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:568edcf7efb32cdaadd6cb0df7a3fe4dfd029fca0873a5295036311a531810c8","observation_id":"51dc88e6-7955-4359-96ba-684e104b9c40","resolution":{"observed_at":"2026-08-11T04:45:37.238189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.218996Z","title":"3dvg- transformer: Relation modeling for visual grounding on point clouds","venue":null,"work_id":"6b24239c-9b56-437b-8b94-fcb8b2722119","year":2021},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.838365Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:31f8f4934d17951d00057a95b8c147e82f10b5e2ef4c3c43f78da75fba5015fb","observation_id":"3800eaa6-e1f8-4f67-9d44-589457b2c39a","resolution":{"observed_at":"2026-08-11T04:45:37.224050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.205218Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":"92504c05-f247-4d53-ae7a-e35b9e97509e","year":2023},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.842717Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:96a4c1f22120f8fee3e3d56e3bb7d7b3b364db57ffbbff6cc42ee15a3e30ef22","observation_id":"669094e5-99c3-44a0-b803-63aa5363df9a","resolution":{"observed_at":"2026-08-11T04:45:37.209863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06773","last_updated":"2023-10-10T16:49:21Z","snapshot_observed_at":"2026-08-16T14:53:22.965811Z","submitted_at":"2023-10-10T16:49:21Z","title":"Uni3D: Exploring Unified 3D Representation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06773","snapshot_observed_at":"2026-08-11T04:45:36.847073Z","title":"Uni3d: Exploring unified 3d representation at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.847073Z"},"links":{"cited_paper":"/paper/2310.06773","citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:77fdbf4654458fee01cd8ee666bc2eb833b98d37ff98f98f01f43a9b23e7ac7d","observation_id":"8976baea-efbc-42f6-8c4f-6ddb1a3455d0","resolution":{"observed_at":"2026-08-11T04:45:36.847073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.191321Z","title":"Opti- mal graph transformer viterbi knowledge inference network for more successful visual navigation","venue":null,"work_id":"ba827c6d-dcc3-4a0f-b9b6-f2d682ead592","year":2023},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.851944Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:17c8db78942af283fa2717b34c1ab34d4e3c2486de6d957d24b459bace20cee1","observation_id":"89fedc51-8929-4d71-baf7-bacc1d4e3e50","resolution":{"observed_at":"2026-08-11T04:45:37.196100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.175881Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":"6ca3401a-6431-4477-aea4-d957216d612b","year":2023},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.856211Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:769f2f4239bca0639c475ec12bcb96a774f55a85ce0d86e7687e1e83a42f08c2","observation_id":"3ae8c7ab-2a96-41db-93de-e002efba6d37","resolution":{"observed_at":"2026-08-11T04:45:37.180461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.161673Z","title":"bath tub","venue":null,"work_id":"40b1d465-c6b9-4aea-a845-1ff521845e63","year":2025},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.860555Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:0a192c8dc1b904551c1ac91c4ca1bf094cb8827b08e48993b5bd222e6e159daf","observation_id":"06ea34ce-d823-42c0-97b6-b0aa9ba5fdf4","resolution":{"observed_at":"2026-08-11T04:45:37.165858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.148440Z","title":"It is sitting beside the tub","venue":null,"work_id":"53fbb4b7-3456-4e79-8a68-78cd33871363","year":null},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.865438Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:2dcbc1d99a67de6d3077cf5fac09f5f5f47ddd0dab058e58037894ea2b326d71","observation_id":"7cb05813-67e3-4ccc-aa5f-aee6fa2e87f3","resolution":{"observed_at":"2026-08-11T04:45:37.152595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.134925Z","title":"It has a towel on top of the lid","venue":null,"work_id":"0491fd2f-1f1c-4f2c-9512-353b4d80a6ae","year":null},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.869919Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:e6ad4545dff3103d44c68c6a04433406a462c5317149bd702844aabd4ce924c2","observation_id":"cdd2b6d0-becb-44f3-8a07-78cf15afca1a","resolution":{"observed_at":"2026-08-11T04:45:37.139086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.120752Z","title":"There is a bathtub to the right of it and a counter to the left","venue":null,"work_id":"22020cf5-69a7-4b66-b88c-112000239413","year":null},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.874411Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:d9cba81d86afb4be7bdb61871365d214cea6dfd11dd87dbac4e8f6a3267fd8e4","observation_id":"cfba65d1-fe31-499a-9ad6-9e340927a428","resolution":{"observed_at":"2026-08-11T04:45:37.125750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:45:37.105843Z","title":"It is the only toilet in the room","venue":null,"work_id":"60f6b9ea-027f-457d-8495-7e4cdf46bb97","year":null},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.878751Z"},"links":{"citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:21ed4f0b1931dd8e0e86ce39173775602b141cac43149a5b7da7328f40bcebae","observation_id":"d6aa3c98-c211-4262-b323-96f3b41fd9d0","resolution":{"observed_at":"2026-08-11T04:45:37.111401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":51},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 4 inbound Pith citation observations for arXiv:2412.18450."}