{"as_of":"2026-08-21T19:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f1e108c7a1c38e1bc8af8fdea4974d303d978c19890fead10b4563d106831011","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T16:00:13.133298Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06534/citation-record","integrity":"/paper/2607.06534/integrity","json":"/paper/2607.06534/citation-record.json","paper":"/paper/2607.06534"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:cdc0fa070913150d691ae81f8f24e5ae3a7523d2100ec736e81c8f83f8fa0dd2","observation_id":"18d113dc-df46-4858-aca8-9ee5694ca5bd","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Longformer: The long-document transformer.arXiv preprint arXiv:2004.05150, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:149b31d05ca5721467129f6357acf782a176a3fd45bf2dbe9d8be40a8171d567","observation_id":"6093b5e2-73ba-4d47-b323-4cff332e5ce9","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Sam 3: Segment anything with concepts, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:bf0ec572635a3b90dc81898b327a666c2e087487e9a9107e1fbf8dc2e5dc9b99","observation_id":"a29dff35-013d-472d-a90c-cd5008ecd547","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00081","last_updated":"2024-10-31T17:53:12Z","snapshot_observed_at":"2026-08-19T21:49:59.609726Z","submitted_at":"2024-10-31T17:53:12Z","title":"PARTNR: A Benchmark for Planning and Reasoning in Embodied Multi-agent Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00081","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Partnr: A benchmark for planning and reasoning in embodied multi-agent tasks.arXiv preprint arXiv:2411.00081, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2411.00081","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:d4f0b0a5382372ecb3d2f940e96126fef157fbcd014cf90d2232d26b9d4dd898","observation_id":"abb6cf32-2618-412d-9753-8afbc5da791a","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:43d7ce6eba27555475d0645aaf87ddcb980fb9f77af20cca2cc437ba89826354","observation_id":"8ce3de25-9e8d-4b6b-9482-dbec9ce1ef56","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Structure-aware transformer for graph representa- tion learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:32063cb2f9081561bdc4e5609b2762c9cfeb81415a234f99cd97584d4bb2e642","observation_id":"dd593664-6fa5-4c1d-8a68-a5cce473f5eb","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Language conditioned spatial relation reasoning for 3d object grounding.Advances in Neural Information Processing Systems, 35:20522–20535, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:ab7e77d84d0b9970cda7142f035eb8812cd232ca999260307796c52d85555e56","observation_id":"c78004cc-3f6d-4142-b167-eb5238b32b78","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18651","last_updated":"2023-11-30T16:00:23Z","snapshot_observed_at":"2026-08-21T15:58:46.613357Z","submitted_at":"2023-11-30T16:00:23Z","title":"LL3DA: Visual Interactive Instruction Tuning for Omni-3D Understanding, Reasoning, and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18651","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding, reasoning, and planning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2311.18651","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:1b863135e25deb94a9b01d55a0acd2710cb6e20c556d0df764657a17989bff90","observation_id":"fe8d2d96-fa5a-47ef-ad23-3c8e8a611cee","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"V ote2cap-detr++: Decoupling localization and describing for end-to-end 3d dense captioning.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:e61dda0606ede478125b3aa209b2ed5edbf9e7a7d41f2c46403ad7711db412c9","observation_id":"73cb8e9f-bd05-4e9c-8d28-1d4c82116ddc","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-18T13:34:10.935081Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Grounded 3d-llm with referent tokens.arXiv preprint arXiv:2405.10370, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:c3abd7f92594249107674e72bb59573a5a871de8e44ff232e7504fd48694c0c1","observation_id":"1da281cf-c681-460b-a0eb-f30c1554eb71","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Scan2cap: Context-aware dense captioning in rgb-d scans","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:e27a5cc5da3db90f3e1593b97c3dde20c78ab2967a6e225d27b44298a36b6135","observation_id":"f38d90ad-c53b-487d-825e-04ec4db55ef9","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Generating long sequences with sparse transformers.arXiv preprint arXiv:1904.10509, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:a11ac0c4994f04e769fae88569128cdc69abc31e2fbbf8822fc8a5bb627e02c0","observation_id":"d81dd9fd-3594-4495-a5a1-a2c6ec9a35af","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:226f3d25aec4da0912c5b8ed20e298509dc99b52a709c11d4cf177dcb6074414","observation_id":"50d261a5-eb1c-4d9e-905a-9ae7cfe49868","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-19T20:46:34.203025Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning.arXiv preprint arXiv:2403.11401, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:045f452e6cf1c96b9ae6e444460187ad84f2c6860f7d7208c261ef9ee12d026e","observation_id":"9a347b4b-5fab-47e4-bef3-2f7b7e637d18","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Conceptgraphs: Open-vocabulary 3d scene graphs for perception and planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:b028ecf39ffb40490808c03160bcd4ac6d89a08ab83dca1c74adda77e2660f95","observation_id":"ff3275c8-3bb9-4a47-91d4-0795ff91d100","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Inductive representation learning on large graphs","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:281b5618695c5b7f4428912910163babbd790e14cff18473e3add8641a963fae","observation_id":"672134eb-02e5-47a5-b15c-0193ac4f1b06","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Language- grounded dynamic scene graphs for interactive object search with mobile manipulation.IEEE Robotics and Automation Letters, 9(10):8298–8305, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:9bb2d2f2ce4814e947c5fe4d40a08498929fc99338c21b53b2266a320ea53f77","observation_id":"1d88bab1-4d95-41c7-a74d-ed4124779002","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12981","last_updated":"2023-07-24T17:59:02Z","snapshot_observed_at":"2026-08-16T15:13:41.464423Z","submitted_at":"2023-07-24T17:59:02Z","title":"3D-LLM: Injecting the 3D World into Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12981","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"3d-llm: Injecting the 3d world into large language models.arXiv preprint arXiv:2307.12981, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2307.12981","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:070d41cbbe671d3d778f4928b29f8a63c35a81cbf44874a192b26f7b25d2abc9","observation_id":"85949127-6c34-428c-864c-8d78daaf9c7b","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-20T11:47:17.477107Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:6647bccbf307f1d3a890dde9fff91c4ab186a35560b680791b9821021d5f41b9","observation_id":"85780207-6dc0-4fb8-9a2c-4f35d74597f0","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-19T04:55:44.810836Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers.arXiv preprint arXiv:2312.08168, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:0a989b9160083432cd5dffc7f2034f32a12a163a6af5e711c4fd85f06b5b8439","observation_id":"6d645eff-9322-418b-bf88-1cc0453a0ee0","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:1b6d088a44f0fb4fe3b27bc9c144fea483c30cb81631834153d5b3b09a1db1f0","observation_id":"b4c7db12-90f0-472e-9256-59719d01bcaf","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"An embodied generalist agent in 3d world.arXiv preprint arXiv:2311.12871, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:55fb347fafbe3eecf1a89183381bb50fc6c3fdf57798ceb417815c454eee769e","observation_id":"81b3c3a5-3096-4ab4-8c28-68326279be89","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Hughes, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:6b080690d8a821fc9cc59f7be0fe67b107da7271e03e2c523928df3191ce53c7","observation_id":"11a95950-a76c-4cc4-8635-79aac8f0637c","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Sceneverse: Scaling 3d vision-language learning for grounded scene understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:a484c238584b06af9e71d56434ec0f54fe806ce0b3294587b8458fef7ff15e10","observation_id":"231d215d-6829-421a-88bd-cd8a3560b065","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Context-aware alignment and mutual masking for 3d-language pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:2c6dd8a68ae6d3269c93b81d761719614cd68d0643658460730a2c0566cc7274","observation_id":"6a99e49b-69fd-4bfb-a92f-dc6f19e05656","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00255","last_updated":"2025-02-20T18:06:19Z","snapshot_observed_at":"2026-08-16T13:13:56.200323Z","submitted_at":"2024-09-30T21:55:38Z","title":"Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00255","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Robin3d: Improving 3d large language model via robust instruction tuning.arXiv preprint arXiv:2410.00255, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2410.00255","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:f9e3328a43f13b42b4aa3dbcd29d4b8c235a94917b88f12d1599569bf6d9d9b8","observation_id":"53eae517-2a04-4d87-84dc-ebf983974cde","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Chang, and Manolis Savva","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:6ce377105eb59dbb94ee6a4204db6aa409096ee74163078017b6cc309e252699","observation_id":"6c0b34c1-8a66-4b66-82ca-1b0416fd7baa","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-16T15:11:32.772599Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Lisa: Reasoning segmentation via large language model.arXiv preprint arXiv:2308.00692, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:0352e5df46f70aaab03a1435f46bc3de24566cd4c37b7a958d0287f647a638c2","observation_id":"92a261bf-a0aa-4bd0-af57-212de3b6fb8d","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Videochat: Chat-centric video understanding.Science China Information Sciences, 68(10): 200102, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:f5b3b290766e8ea85da577fdd5928bd24d87c517435585e199058e121ce8713d","observation_id":"1eeda62c-6ff5-44e1-871e-7666a122c453","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15729","last_updated":"2024-04-24T08:37:13Z","snapshot_observed_at":"2026-08-18T06:57:03.436915Z","submitted_at":"2024-04-24T08:37:13Z","title":"Gradformer: Graph Transformer with Exponential Decay","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15729","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Gradformer: Graph transformer with exponential decay.arXiv preprint arXiv:2404.15729, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2404.15729","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:3afad4b7c4e7d300a88dccbf25ec8bccfbd56fc5dc5d01a5b5a9f3898139482b","observation_id":"2432d7fc-c235-4e75-b994-546c51ec4e3f","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Improved baselines with visual instruction tuning.arXiv preprint arXiv:2310.03744, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:724efd873eec4e337a43a9899c02931e01a1aca93b9ea5254dd8c3c2b401adc8","observation_id":"1e7c65c4-845c-4fee-8682-829399bca933","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Visual instruction tuning.arXiv preprint arXiv:2304.08485, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:78ca1f0dfafa2099f6b582ce386d40d98bd64d2107f4d049c8a697d13003f50e","observation_id":"c64a1162-17b2-4e73-bbdb-b13bcb9acf60","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:41a990a30b91577f564d0ab96f5c03202a7c1df9842ffd119e33962f3f808667","observation_id":"ac8571d8-371f-47c4-a69a-c6022e24db79","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Spatialpin: Enhancing spatial reasoning capabilities of vision-language models through prompting and interacting 3d priors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:8c1ff9615a0db1c61f2d2f40fdc4a2c475aa0ea89b17566d49ef6f3e84619ac4","observation_id":"8039ebf8-a282-4033-8622-266947f928a5","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Coopera: Continual open-ended human-robot assistance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:8e55d4098ecc197826b54f120cc39b9b55e74ed7cb3b8d493784d7c77e9b9b5c","observation_id":"86527407-ee36-4d03-88c6-b7e2199b2697","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Cyclevla: Proactive self-correcting vision-language-action models via subtask backtracking and minimum bayes risk decoding.arXiv preprint arXiv:2601.02295, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:958b3c787c55b9cb44962c39401130dfa6d035306d9690df92cb34321fbf1818","observation_id":"5bbd0dd0-64e9-4099-8b3e-3dd7bbbe172b","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Sqa3d: Situated question answering in 3d scenes.arXiv preprint arXiv:2210.07474, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:910a9ac67c1d5d5a56b73813371388fdd2a94b85ce9f0c058280cd89e32503c4","observation_id":"6d7833d2-f947-402c-8f2f-9c41c8434e18","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:44c89581bcf5d8d93b93ba56ede2ba69cbe7aef576f3a51a59065af22178c78f","observation_id":"eab4be75-4893-4ee8-b8e5-8024a106ac54","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-08-07T11:26:24.970964Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Train short, test long: Attention with linear biases enables input length extrapolation.arXiv preprint arXiv:2108.12409, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:144ccc1c8f1dfa5fdf7a61c70dc9c316589b8947d2e5291bb623d87d2ff2426e","observation_id":"ee8a8ff2-5bec-4c2e-ba9c-559777b0249d","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Virtualhome: Simulating household activities via programs","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:2fa366a1968ca4f2e1340fe3f69363d594ba305793ccd414c2222e7f2655e9c6","observation_id":"7da5096e-7bb0-4516-ae76-90ecc597f730","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.09890","last_updated":"2021-05-03T13:08:55Z","snapshot_observed_at":"2026-08-16T19:12:16.718235Z","submitted_at":"2020-10-19T21:48:31Z","title":"Watch-And-Help: A Challenge for Social Perception and Human-AI Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.09890","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Watch-and-help: A challenge for social perception and human-ai collaboration","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2010.09890","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:c4aaac04b7b877ea318500579f73b5ed8d6b2d47207f66b94c8a380c71cf4558","observation_id":"8b09774e-cfb5-4f95-963d-35b1ef020cd8","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13724","last_updated":"2023-10-19T17:29:17Z","snapshot_observed_at":"2026-08-16T14:50:37.751196Z","submitted_at":"2023-10-19T17:29:17Z","title":"Habitat 3.0: A Co-Habitat for Humans, Avatars and Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13724","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Habitat 3.0: A co-habitat for humans, avatars and robots.arXiv preprint arXiv:2310.13724, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2310.13724","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:9d9175c7603faae51a0278d27a9cfa937cac570881532c88c49d7a51973dfb59","observation_id":"ef7cd8c7-a793-46c6-8dd9-b1459c24fdf4","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-08-15T04:16:11.827389Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01428","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Gpt4scene: Understand 3d scenes from videos with vision-language models.arXiv preprint arXiv:2501.01428, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2501.01428","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:35f805fef32113655380f6f6cf243d43233317e3b433bdf856c6c1e16b98ae24","observation_id":"fbb5f7de-c5d8-41ae-84f1-d333c7925267","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08238","last_updated":"2021-09-16T22:01:24Z","snapshot_observed_at":"2026-08-15T09:50:41.483833Z","submitted_at":"2021-09-16T22:01:24Z","title":"Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08238","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Habitat-matterport 3d dataset (hm3d): 1000 large-scale 3d environments for embodied ai.arXiv preprint arXiv:2109.08238, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2109.08238","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:37a6a56032797791b216ad3aa1b2b505a87fa91ac87e824a8a369dbbff423f65","observation_id":"72b9cd3f-1cee-4d5a-943e-0e7a70f062ad","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06135","last_updated":"2023-09-27T23:17:28Z","snapshot_observed_at":"2026-08-18T06:57:48.777172Z","submitted_at":"2023-07-12T12:37:55Z","title":"SayPlan: Grounding Large Language Models using 3D Scene Graphs for Scalable Robot Task Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06135","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Sayplan: Grounding large language models using 3d scene graphs for scalable robot task planning.arXiv preprint arXiv:2307.06135, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2307.06135","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:e7420f76dc6995274fb83b2d48f02127359fa4c0324b2b97986e42c1f300ec9d","observation_id":"98e9f947-7003-48a4-a3df-5864d3af193b","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Mask3d: Mask transformer for 3d semantic instance segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:7048189bc46b734b8ffa284a38a803c15a2ebc7c429105776c49971f0712a1ae","observation_id":"4dceaeec-536c-49bc-8cd8-193fad153315","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:9e06f43f3eb7658e1d79f5fbfd0bba348ea7fd9687aa7a98cf2b47f854e2d49f","observation_id":"6bec8900-f821-4dc3-a3fd-9423f61bbea0","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05689","last_updated":"2025-06-06T02:35:26Z","snapshot_observed_at":"2026-08-18T22:26:19.671067Z","submitted_at":"2025-06-06T02:35:26Z","title":"Pts3D-LLM: Studying the Impact of Token Structure for 3D Scene Understanding With Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05689","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Pts3d-llm: Studying the impact of token structure for 3d scene understanding with large language models.arXiv preprint arXiv:2506.05689, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2506.05689","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:f0d781f432ea5d6861f76cebd04bfe51c875a7392a6d40c45f18a9b64134504c","observation_id":"90eb3ffe-4717-4df7-9f66-134393fe633d","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Vl-sat: Visual-linguistic semantics assisted training for 3d semantic scene graph prediction in point cloud","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:bab2aeed9b27550ae8acc3787a7cf50c323644c1df93b3f7af6e2a6b8fac4e35","observation_id":"9da267cb-c9fd-4ddf-a9d6-fc519d3b5842","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Hier- archical open-vocabulary 3d scene graphs for language-grounded robot navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:da16e03199ae01d9c1de45eaa14c87b47fc5d45ba3abef8c0912a4aca7811736","observation_id":"61be677b-120e-4c62-b730-24e8dde14bad","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00632","last_updated":"2024-06-30T09:14:33Z","snapshot_observed_at":"2026-08-16T13:38:25.604908Z","submitted_at":"2024-06-30T09:14:33Z","title":"CAMON: Cooperative Agents for Multi-Object Navigation with LLM-based Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00632","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Camon: Cooperative agents for multi-object navigation with llm-based conversations.arXiv preprint arXiv:2407.00632, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2407.00632","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:0f2d2cee6595bc2bb4c66de96e5f66e5c15f0fdf93b3b981ba5d67b67eeccbf1","observation_id":"80495fc6-c120-4d4b-b23b-ba311b4775aa","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"3ur-llm: An end-to-end multimodal large language model for 3d scene understanding.IEEE Transactions on Multimedia, 27: 2899–2911, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:0f2266fb2afd5f8166123256b2c3cd7207e755fca3d28243212afdc1530c5fef","observation_id":"c6a6da55-e19a-4953-9282-fefb9ee759fa","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Descrip3d: Enhancing large language model-based 3d scene understanding with object-level text descriptions.arXiv preprint arXiv:2507.14555, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:24108207f3b485452e9617be02df0c29c3086c5a629172a9bf18860285ef8b16","observation_id":"45d0eba0-a298-4438-825f-c87b9e76e99e","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember and Recall Spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:c29601cb69aae113a27ec3cdaa046ab86db3eb8c410173504ae8028ba5508f78","observation_id":"f0d30aa6-cc46-4dfc-8d64-6b5af58ca6c1","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11565","last_updated":"2024-01-10T14:20:30Z","snapshot_observed_at":"2026-08-18T03:22:09.534198Z","submitted_at":"2023-06-20T14:30:32Z","title":"HomeRobot: Open-Vocabulary Mobile Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11565","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Homerobot: Open- vocabulary mobile manipulation.arXiv preprint arXiv:2306.11565, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2306.11565","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:c97c8379ea9916fdc17c6682c048da23f02657a4c9e4136eff06cbec35330601","observation_id":"c6545e75-d4e4-44af-b350-3270f63cf087","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Do transformers really perform badly for graph representation?Advances in neural information processing systems, 34:28877–28888, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:6f5070e0868ee7a998b55abacefbee8d88c985d3ff8e6635539ef980bff384b5","observation_id":"31703ae3-c50c-4801-b584-a2955fc490a8","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-08-12T17:07:18.793418Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Ferret: Refer and ground anything anywhere at any granularity.arXiv preprint arXiv:2310.07704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:e695bf9a08c7279b49de9ac70f7e3a06dc27a0646eff2530190722de03621dab","observation_id":"c58a59f4-c85e-4ab0-a1ae-37115813a222","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Inst3d-lmm: Instance-aware 3d scene understanding with multi-modal instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:524e586d264685bde8a6d524d14509bb1b85c215e9d7a2afaeb84a10b5af804c","observation_id":"d14963bf-45f9-4ee6-b63f-a2a5bf184e64","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:b3daa16f35dc38cfb2e5ffe6a85a07a4a79cfe4d30561386b3286a8a4e607c8d","observation_id":"ae538b21-02db-4513-a29b-d949a67e8a23","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18450","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"3dgraphllm: Combining semantic graphs and large language models for 3d scene understanding.arXiv preprint arXiv:2412.18450, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2412.18450","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:f25ac5b6ad3a682719b2197caf9672fb548bff95f51396bb3016598e0b38c5a4","observation_id":"e1b60801-1547-4a74-9c20-7ce8b66a2a9a","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Multi3drefer: Grounding text description to multiple 3d objects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:81940a6b0dc351d5077265f9dc5cfb44f4160c52123413c007b8af6b21ace381","observation_id":"43830ec1-18cc-4a42-8487-d91eaab667d2","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"3dvg-transformer: Relation modeling for visual grounding on point clouds","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:785d8fe9e05fa07fa70d41d554b165054075f25e7408992fe6a0283ea13fa063","observation_id":"275ac01e-0370-46f5-8b5d-3a42a63baeae","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08581","last_updated":"2023-07-17T15:51:47Z","snapshot_observed_at":"2026-08-16T15:15:39.618749Z","submitted_at":"2023-07-17T15:51:47Z","title":"BuboGPT: Enabling Visual Grounding in Multi-Modal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08581","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Bubogpt: Enabling visual grounding in multi-modal llms.arXiv preprint arXiv:2307.08581, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2307.08581","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:2cb8a405f3891aa52e73aba463ebe54834024a920e304346b8d0750e797198cb","observation_id":"40876b77-b838-49e0-8447-3d26b5d35922","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Lscenellm: Enhancing large 3d scene understanding using adaptive visual preferences","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:4c89a4129747fc61c8fc9ced77fdca9f0ba23f4e841bb102ec8c83a71ec81e8c","observation_id":"1c0e8e9a-66ba-4de5-99df-f09942d2d45f","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06773","last_updated":"2023-10-10T16:49:21Z","snapshot_observed_at":"2026-08-16T14:53:22.965811Z","submitted_at":"2023-10-10T16:49:21Z","title":"Uni3D: Exploring Unified 3D Representation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06773","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Uni3d: Exploring unified 3d representation at scale.arXiv preprint arXiv:2310.06773, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2310.06773","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:40de082b10e9b8fa0eb065651123421cba6753070359f2bb3b1b61bd7545648b","observation_id":"16b844de-e247-4a59-8dd6-893f6907134c","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:8317da19fd787673bdbdb13d8822ed1995127ef97f9b262738c313f2bd2fbb52","observation_id":"246857a5-26a0-4628-8f81-3ffbafb0b847","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Unifying 3d vision-language understanding via promptable queries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:4b3462c7c3fd5abc75bc62f78fa4f1a4c34cf2060d396547549b655116da23d1","observation_id":"3e550046-13ab-4117-a8a3-a83962f5ac53","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"the tablebetweenthe sofaandthe bookshelf,next tothe lamp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:e92f94c91385adde10e0fa21d84d233fffd7e7d8b572619397eebfc7760c4e19","observation_id":"a7554b1a-c3ad-448d-b301-5a7916f53a12","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"the chairnext tothe deskthat supports the monitornearthe window","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:5f95a2873062532b370f0efdcc5b289846a512e699836e0a1f29c14ae5b5771d","observation_id":"55b82348-49fa-424b-bdc0-1622f54c577a","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"the lampabovethe nightstand, where the nightstandis next tothe bedthat facesthe window","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:c0615a7387d9101bbf4ec302f9f3a730bc6dc779336fc6a28c4df76604a2cd33","observation_id":"78de21ff-1c22-44d1-a730-f60cecad06a8","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Q:” and ending with “?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:b5b8450c0a4352fd1c70d4b46c25d5a3bdcaca34a1cd16bb39bfbaeb9537db03","observation_id":"e3774508-7c74-4d8a-94da-840c12956ed8","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"what” or “which object","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:c55f129c253932baccf6560c18d82c533409af770e8de79813e6cb2d627f2918","observation_id":"0cbcf9e3-3703-4a02-89bd-e6366a03efbc","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:c0c485e308c7ff0b6498a46673a986d3df88a9cd2a98ca594dbef479df47dbad","observation_id":"696ec95e-af61-488d-b30a-1e7a7a98b28e","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"In {room}, how many {class} are there?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:c38019b4063902c1dab39ec984793df4b00eb9624b85ffe7af3ec2ea0f8b3f09","observation_id":"a8e61a81-3cdf-479d-a34b-0cf784834890","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T11:44:09.961999Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":74,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 0 inbound Pith citation observations for arXiv:2607.06534."}