{"as_of":"2026-08-08T00:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d35a10f9727a63adbe4252cf7e320274fb78b5b1027a503fa096e44789952892","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:02:33.215747Z","state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T19:54:57.184897Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T19:03:08.599602Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04047","snapshot_observed_at":"2026-08-05T19:54:57.184897Z","title":"Move to understand a 3d scene: Bridging visual grounding and exploration for efficient and versatile embod- ied navigation.arXiv preprint arXiv:2507.04047, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11476","last_updated":"2025-08-15T13:44:56Z","snapshot_observed_at":"2026-08-07T16:52:47.993111Z","submitted_at":"2025-08-15T13:44:56Z","title":"SPG: Style-Prompting Guidance for Style-Specific Content Creation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:57.184897Z"},"links":{"cited_paper":"/paper/2507.04047","citing_paper":"/paper/2508.11476"},"observation_digest":"sha256:02fc2dec0298fc85e0b427e9380360649c144e9d0770238f807e0c028efde303","observation_id":"8b12b765-c17c-4532-8932-0c2f5ffe3a7d","resolution":{"observed_at":"2026-08-05T19:54:57.184897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"cited_work":{"arxiv_id":"2507.04047","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04047","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Move to understand a 3d scene: Bridging visual grounding and exploration for efficient and versatile embodied navigation","venue":null,"work_id":"0e2bb609-bbd8-4c6c-b14d-5b1c3d3c8775","year":2025},"citing_paper":{"arxiv_id":"2604.03139","last_updated":"2026-04-03T16:01:58Z","snapshot_observed_at":"2026-07-06T22:52:25.307426Z","submitted_at":"2026-04-03T16:01:58Z","title":"FSUNav: A Cerebrum-Cerebellum Architecture for Fast, Safe, and Universal Zero-Shot Goal-Oriented Navigation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T18:58:48.779518Z"},"links":{"cited_paper":"/paper/2507.04047","citing_paper":"/paper/2604.03139"},"observation_digest":"sha256:b6ec0d8fae7790d687ce341ea6de58721c6a05adcd7827fab599d635a066ef09","observation_id":"7363683b-1a7a-41e1-8f77-a918c1574094","resolution":{"observed_at":"2026-05-13T19:03:08.600996Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04047/citation-record","integrity":"/paper/2507.04047/integrity","json":"/paper/2507.04047/citation-record.json","paper":"/paper/2507.04047"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:31.156912Z","title":"Scanents3d: Exploit- ing phrase-to-3d-object correspondences for improved visio- linguistic models in 3d scenes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:31.156912Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:9c18185923ae7889440b81cc1505e8c37c7c6de581509942e8cc52f463cd1f5c","observation_id":"e2a31111-e2e4-4890-a72a-2b5fe7745999","resolution":{"observed_at":"2026-08-06T20:02:31.156912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:31.251850Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:31.251850Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:a3d08056755a1470b3071a8ac102cd9513c6a2eb95dacc07d3e4b181b113ee3d","observation_id":"7f2de7b2-1a14-431d-a5c8-30bbdd9a6843","resolution":{"observed_at":"2026-08-06T20:02:31.251850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:31.317126Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:31.317126Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:648d80628792e9c43b196f20d1f85e295e6faab00aaf129e0b010c4ac5d493f2","observation_id":"d4f365fa-c59c-42b1-9e52-546e5375435c","resolution":{"observed_at":"2026-08-06T20:02:31.317126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:31.434833Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:31.434833Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:b2f8077a5838c84aa7ded81523997b1b19d22c2f2203bd1f9a8131362dc8b286","observation_id":"c49bc4df-6ccb-4a9e-9bbe-fd1b50ea2390","resolution":{"observed_at":"2026-08-06T20:02:31.434833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:31.497301Z","title":"3djcg: A unified framework for joint dense captioning and visual grounding on 3d point clouds","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:31.497301Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:da014bfae0e5d5562e100f147600f5f367cfc5adbb06c0d8ace40e53a107e008","observation_id":"bb7ccfdb-041b-411f-993c-23f9995f6668","resolution":{"observed_at":"2026-08-06T20:02:31.497301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:31.605674Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:31.605674Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:b3691d940dc42a790df54d5c400ec7dc469954ee5e63e7ee7c66bcadfa9b9ded","observation_id":"f9dddfbd-8cbb-48ea-b292-57527f9aadad","resolution":{"observed_at":"2026-08-06T20:02:31.605674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:31.679473Z","title":"Object goal naviga- tion using goal-oriented semantic exploration","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:31.679473Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:06542bef39e8b68d4562acc094ddcf458a8aab49899f897fd39f3382c83c627f","observation_id":"deda0b58-fc06-49a7-b970-3e239931f8ae","resolution":{"observed_at":"2026-08-06T20:02:31.679473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:31.763679Z","title":"Object goal navi- gation using goal-oriented semantic exploration","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:31.763679Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:165848d98121afacf6ccaacaecc201a641d0d945b6d9afc989f88c35340f6764","observation_id":"b823c8a9-85dc-4284-8432-c24334a7769b","resolution":{"observed_at":"2026-08-06T20:02:31.763679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:31.842833Z","title":"Scanrefer: 3d object localization in rgb-d scans using natu- ral language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:31.842833Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:a9179132600d885240ae4f44bffdeca9b519c1f4acb2dcbc3d8600c506284bd9","observation_id":"86802e41-5707-4c97-87d5-a88d5deb6b24","resolution":{"observed_at":"2026-08-06T20:02:31.842833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:31.924326Z","title":"Language conditioned spatial relation reasoning for 3d object grounding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:31.924326Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:d4f104028ff0f6c66b5716e53dee36b7b2646ac9d4754c711769acc4c0963ac8","observation_id":"06333299-344d-4207-b617-3a79b9607d6c","resolution":{"observed_at":"2026-08-06T20:02:31.924326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:32.014240Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understand- ing reasoning and planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.014240Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:d234fec279def8838e2be266bc1b17da0ab05a28232ac1ef10118f008f6a45e5","observation_id":"778803a5-506f-493f-99d9-949b414b8d32","resolution":{"observed_at":"2026-08-06T20:02:32.014240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:32.057605Z","title":"Scan2cap: Context-aware dense captioning in rgb- d scans","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.057605Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:f7ed483922bed8474f81b4ac527cd3816dff63cbdfd36e6fd87a94c190d0da85","observation_id":"e4822169-e117-457f-8f5d-242e6d091ec3","resolution":{"observed_at":"2026-08-06T20:02:32.057605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:32.194145Z","title":"Unit3d: A unified trans- former for 3d dense captioning and visual grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.194145Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:b56fd5d8cfa3bba17434ce39b5f521345fe674f73bca423d452083470068413e","observation_id":"26c200ce-8196-49a5-a404-ede974461053","resolution":{"observed_at":"2026-08-06T20:02:32.194145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:32.284849Z","title":"Schwing, Alexan- der Kirillov, and Rohit Girdhar","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.284849Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:5f913690298e290af7ad619dfd14c090232a1b29b46aec28e17753632000294c","observation_id":"96a42d0e-704e-4d5e-b86c-f82703300d84","resolution":{"observed_at":"2026-08-06T20:02:32.284849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:32.391830Z","title":"4d spatio-temporal convnets: Minkowski convolutional neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.391830Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:9a3b1221a1c32425b7fefa1d936ff5c7bf14a8702f44932d96cdbf81353bc594","observation_id":"ed1e8638-0b8a-4a26-9984-d39ecfa84001","resolution":{"observed_at":"2026-08-06T20:02:32.391830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:32.507880Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.507880Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:c23da970a9ae0b9886aa5faf99538f7cf47d477fec00d4386f2f7e66c69bd2e8","observation_id":"17ccbf1e-189e-4f93-b408-cafceb94bcaf","resolution":{"observed_at":"2026-08-06T20:02:32.507880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.658244Z","title":"Embodied question answer- ing","venue":null,"work_id":"b8bc263a-b12d-4018-9f0f-76d63cc9f494","year":2018},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.605207Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:d65f76ed85b14236011da5c172b6983d6dd6538ec2c6c45d95d6454b88f38edf","observation_id":"23dd4bc8-824e-48b8-99bd-72233555fe15","resolution":{"observed_at":"2026-08-06T20:02:34.662553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.644143Z","title":"A survey of embodied ai: From simulators to research tasks","venue":null,"work_id":"baa51a08-58f7-4ab3-88a8-549c454a4a70","year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.730308Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:548a7ce4f90d4e354b44fb252d85f73430332d66f846f79a4bf22b0b8d9f64df","observation_id":"fec0ec8e-b139-451f-b6b8-91dcf8ba2993","resolution":{"observed_at":"2026-08-06T20:02:34.648665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14401","last_updated":"2025-05-23T21:41:56Z","snapshot_observed_at":"2026-08-06T15:59:05.107483Z","submitted_at":"2024-12-18T23:15:41Z","title":"The One RING: a Robotic Indoor Navigation Generalist","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14401","snapshot_observed_at":"2026-08-06T20:02:32.828420Z","title":"The one ring: a robotic indoor navigation generalist","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.828420Z"},"links":{"cited_paper":"/paper/2412.14401","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:206b4b0ad860616f9c10636685d2f010c562067c9e7605728a8395e02d36828a","observation_id":"6db28803-3cf2-4251-ad77-654dcd228b67","resolution":{"observed_at":"2026-08-06T20:02:32.828420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.628659Z","title":"Spoc: Imitating short- est paths in simulation enables effective navigation and ma- nipulation in the real world","venue":null,"work_id":"5f5116c6-fdfd-4b97-9bdf-d7fd2738bc1a","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.859253Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:488bfd7d378871d5a5eda623834601b03ec16dd033e13110913fda7ca74c73d5","observation_id":"4a984db5-a1cb-4e85-842d-0a3a593d6b52","resolution":{"observed_at":"2026-08-06T20:02:34.633572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00358","last_updated":"2025-01-09T03:25:24Z","snapshot_observed_at":"2026-08-02T14:48:37.585697Z","submitted_at":"2024-12-31T09:22:38Z","title":"Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00358","snapshot_observed_at":"2026-08-06T20:02:32.864163Z","title":"Embodied videoagent: Persis- tent memory from egocentric videos and embodied sen- sors enables dynamic scene understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.864163Z"},"links":{"cited_paper":"/paper/2501.00358","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:bf02390e25caa6e7973438b99b934462240ba170de3914eeb3307f6826285556","observation_id":"713006fa-6b05-414d-a629-451cd2717320","resolution":{"observed_at":"2026-08-06T20:02:32.864163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.613926Z","title":"Efficient graph-based image segmentation","venue":null,"work_id":"0f77a1a6-69c0-4095-81a1-e07a06989954","year":2004},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.869619Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:d45afaaa90d753d6911d68b7ee67e59377b98db2e54d496827fd0f90aa8bd6ab","observation_id":"07a13e23-4b26-4210-91eb-1174c07e9df7","resolution":{"observed_at":"2026-08-06T20:02:34.618261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.599288Z","title":"Cows on pasture: Base- lines and benchmarks for language-driven zero-shot object navigation","venue":null,"work_id":"6fe604d3-a144-4ae2-a0d2-ab70abeacf7d","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.873766Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:75539aeb9eb10fb696f2174347f175a7a9bd3870e7839fb5c700e043620b6ade","observation_id":"1a3fd2f0-a809-4758-ad4d-a2be5e0be2cc","resolution":{"observed_at":"2026-08-06T20:02:34.604356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.585357Z","title":"Scaling open-vocabulary image segmentation with image- level labels","venue":null,"work_id":"16506f23-9d06-464b-b2b9-bff823714940","year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.878891Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:9531dd0466229091ad46f0f657d4daa713474d1af9e3c0d96fcc4dca4c268f22","observation_id":"8c68ce8f-f0a4-4e70-9234-da915752a457","resolution":{"observed_at":"2026-08-06T20:02:34.589762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.571316Z","title":"Conceptgraphs: Open-vocabulary 3d scene graphs for per- ception and planning","venue":null,"work_id":"9ac16c48-fdf1-4737-8328-12309d818d25","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.883132Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:c0d6e251a2beb59d18dc861aaf39299690d0960821fbd424a63e921fc1bdb8e8","observation_id":"45f432e4-e104-4efe-9322-2a706db8a7fa","resolution":{"observed_at":"2026-08-06T20:02:34.575555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.556752Z","title":"Viewrefer: Grasp the multi-view knowledge for 3d visual grounding","venue":null,"work_id":"0afd5c8c-be38-480a-98fc-2608da4c2c3b","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.887401Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:a5bbad8f7aa61d21d3b06730074d32756917555239a2662fe66169f93ee218f5","observation_id":"adf93ba6-943c-4359-bfef-d23cc8551d51","resolution":{"observed_at":"2026-08-06T20:02:34.561287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.542052Z","title":"Transrefer3d: Entity-and- relation aware transformer for fine-grained 3d visual ground- ing","venue":null,"work_id":"a0b38533-dab0-4e12-bb32-f7caa4370dde","year":2021},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.891844Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:af5552908cf3b42719fc39cdd35bf36a04fa92a36358a12b09f394891c0de580","observation_id":"7d587f8b-2923-40f4-8826-daaabe53f5d4","resolution":{"observed_at":"2026-08-06T20:02:34.546556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.527279Z","title":"Vln bert: A recurrent vision- and-language bert for navigation","venue":null,"work_id":"37f47850-15e0-4cb2-b806-17a5e6af1816","year":null},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.896182Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:c93c2bf8ff0fb619331358f78319b34bae50b7b7ac50e36b635782fa254655e2","observation_id":"0a0a1021-5c64-4d71-8425-ea1db88b305a","resolution":{"observed_at":"2026-08-06T20:02:34.531842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.510783Z","title":"3d-llm: In- jecting the 3d world into large language models","venue":null,"work_id":"fa22017c-d213-4eea-9628-a35bb586824d","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.901425Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:b2f78fad1431bcd9e4142b5a673bdcde7c6c2fca3b3970032f5bcbf2b4a771be","observation_id":"d4c652b4-9733-408a-8d2e-c5eb0468f7ee","resolution":{"observed_at":"2026-08-06T20:02:34.515695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.493517Z","title":"A real-time occupancy map from multiple video streams","venue":null,"work_id":"5c99ac42-5c41-4e4a-93df-931f22247636","year":1999},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.906117Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:200bf8dbbdea15d7c53702347034f40d7664c4e617f5a1c2d32f4a4f4c572597","observation_id":"7f29a1b4-1c1e-4eb9-955e-9b9381b77dcd","resolution":{"observed_at":"2026-08-06T20:02:34.498323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.475938Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":"3fce9eb9-595e-467c-b6cf-9dd218879788","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.910518Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:1cbe9cdd6dcbfc96959c0e3e77e79d5ed7a0c6054653d69371617394ee04abe7","observation_id":"9f43c2d6-7681-47f4-b4a6-54b61de930e7","resolution":{"observed_at":"2026-08-06T20:02:34.481002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.459292Z","title":"Language models as zero-shot planners: Ex- tracting actionable knowledge for embodied agents","venue":null,"work_id":"bc8e5669-4866-4c63-8b01-a8f220e6ef74","year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.914903Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:c9d0050f411556d90e4fcb6b5f3d785538d81256a5ef563c75c2a7b375ff511e","observation_id":"4c5594b4-3ee3-422a-b71b-7dba27b78f5f","resolution":{"observed_at":"2026-08-06T20:02:34.463894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.443566Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models","venue":null,"work_id":"7c3e2521-3ec9-4265-b70d-b52dfa3cfcd6","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.919522Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:1a599cfba127cc0d7a43c69f4fac1e5ad668f3490e8b8ed9d6ae0f4f44ad19cf","observation_id":"143deb32-0c82-488b-81f8-15730725a8d9","resolution":{"observed_at":"2026-08-06T20:02:34.448269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.428272Z","title":"Bottom up top down detection transform- ers for language grounding in images and point clouds","venue":null,"work_id":"18329468-f01f-47fc-8dce-5265a2cc770c","year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.924413Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:128528d23b9ba43bd4fadfa517a8c5d9d7452c3a92e206476cc21d62f835300c","observation_id":"39bbe7cb-7eaf-46c9-a293-620806b5320b","resolution":{"observed_at":"2026-08-06T20:02:34.433025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.412610Z","title":"Conceptfusion: Open-set multi- modal 3d mapping","venue":null,"work_id":"f77575a0-fb25-4440-a79e-45c836ff5429","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.929001Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:e501600541d78a9f5ed74f7a8c9df3e49b39ea8a510977a0905e3897e9d296c9","observation_id":"8f216072-19fc-4d8f-9511-ee0f109fc652","resolution":{"observed_at":"2026-08-06T20:02:34.417777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.397324Z","title":"Sceneverse: Scaling 3d vision-language learning for grounded scene understanding","venue":null,"work_id":"a0a6ef23-c425-47db-9166-d676f09a1c03","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.934381Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:6225f56eaf64680324cebac11528bd5946c3d5c403380ff55ec1d052fe49d83f","observation_id":"e52ef426-8946-4d81-856e-63b42e949343","resolution":{"observed_at":"2026-08-06T20:02:34.402368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.381864Z","title":"Goat-bench: A benchmark for multi-modal lifelong navigation","venue":null,"work_id":"9aed0ca2-79e1-4946-b24e-88ca416c04e5","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.939241Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:93eb225398ac7ca0263d8c9710bdd88c3503633d4b26c322e4bb431a7f5879a5","observation_id":"b46b61ae-463b-42ff-a9ca-487841e009f3","resolution":{"observed_at":"2026-08-06T20:02:34.386201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.366988Z","title":"Realfred: An em- bodied instruction following benchmark in photo-realistic environments","venue":null,"work_id":"7014e382-5166-43c4-8fb1-dd6987fe5f67","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.943797Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:4f6436531ded0262274b4379da53a9741d94d562b8e813aa6d2d1a570165f502","observation_id":"9eeaf62f-5c89-4be2-be2a-02d3f7d04fb8","resolution":{"observed_at":"2026-08-06T20:02:34.371553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.352419Z","title":"Segment anything","venue":null,"work_id":"3883ed5f-892f-4a02-85e2-3a0c81d7578c","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.948191Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:cd9da1b0713c56062790ac92b7f73b232c15e680b2445659330dd02e741b82a6","observation_id":"30f6df15-b03d-4f0c-b060-014a2e9d8e01","resolution":{"observed_at":"2026-08-06T20:02:34.357025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13430","last_updated":"2022-10-31T12:36:18Z","snapshot_observed_at":"2026-07-06T13:56:50.670071Z","submitted_at":"2022-09-27T14:36:16Z","title":"UniCLIP: Unified Framework for Contrastive Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":"2209.13430","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.13430","snapshot_observed_at":"2026-08-06T20:02:33.571355Z","title":"UniCLIP: Unified Framework for Contrastive Language-Image Pre-training","venue":"cs.CV","work_id":"0445b6ce-e489-463e-b52d-4dba2578dc1a","year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.952478Z"},"links":{"cited_paper":"/paper/2209.13430","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:4ad4dcd4eca0db6a6a2dff4e0990c55d877a0d57170d747185669da977d7c92d","observation_id":"b1919572-cd83-449d-826b-e48b8505acfe","resolution":{"observed_at":"2026-08-06T20:02:33.577190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.338211Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling","venue":null,"work_id":"f97d4c73-8773-49de-9c5f-033afbf51b36","year":2021},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.956776Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:3e0ab47a6806ad56b70d82ea016ac373fc846df5f775b4a242a2d6e1dd9cf735","observation_id":"8207f357-d3b8-407e-a437-96f5b9a07aa8","resolution":{"observed_at":"2026-08-06T20:02:34.342337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09227","last_updated":"2024-03-14T09:48:36Z","snapshot_observed_at":"2026-08-06T09:37:53.788323Z","submitted_at":"2024-03-14T09:48:36Z","title":"BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09227","snapshot_observed_at":"2026-08-06T20:02:32.960840Z","title":"Behavior-1k: A human-centered, embodied ai benchmark with 1,000 everyday activities and realistic simulation.arXiv preprint arXiv:2403.09227, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.960840Z"},"links":{"cited_paper":"/paper/2403.09227","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:9f307b0d1dd5dc483b1976a6858cf70a1caad21009f5bece27067cb76fa8a6ab","observation_id":"ad92fa97-2683-4468-9993-289fb62236ff","resolution":{"observed_at":"2026-08-06T20:02:32.960840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-06T20:02:32.966191Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.966191Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:0376325358ae5ac95e1b152c4c318d47da089ba0c8e719b3e9183fd3aa36740f","observation_id":"7d582015-4573-4d72-90f1-53a9abbd8ed0","resolution":{"observed_at":"2026-08-06T20:02:32.966191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.323485Z","title":"Panoptic segformer: Delving deeper into panoptic segmen- tation with transformers","venue":null,"work_id":"15a2cf2c-651b-4cb1-a385-e40f613d32b9","year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.971408Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:dd34a72200895a78ef40e7d607ae49b8f244d3309775f91dec1f80b0b75e8e98","observation_id":"2a1c475a-e27f-4406-9282-799d56d74131","resolution":{"observed_at":"2026-08-06T20:02:34.328116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.307514Z","title":"Code as policies: Language model programs for embodied con- trol","venue":null,"work_id":"1e51ae58-27a9-4e9d-9f02-024a7cc64c66","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.975605Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:8b6da54c8e2fe357ecb6238628b1361f8a5d3ddb7ee8c2f9e7da52a0750683a3","observation_id":"53c90110-e900-4bf6-b726-6d8daf6d9d1e","resolution":{"observed_at":"2026-08-06T20:02:34.312598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07376","last_updated":"2025-03-22T11:04:36Z","snapshot_observed_at":"2026-07-06T17:43:05.793351Z","submitted_at":"2024-03-12T07:27:02Z","title":"NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07376","snapshot_observed_at":"2026-08-06T20:02:32.980063Z","title":"Navcot: Boosting llm-based vision-and- language navigation via learning disentangled reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.980063Z"},"links":{"cited_paper":"/paper/2403.07376","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:dd2cbb513f50d411e1e510904e9926457df910e56594d85677876efcc5f2c1bf","observation_id":"b986deef-cc20-4681-a7cf-88509af4eabd","resolution":{"observed_at":"2026-08-06T20:02:32.980063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06886","last_updated":"2025-08-25T02:20:09Z","snapshot_observed_at":"2026-08-06T16:04:56.349386Z","submitted_at":"2024-07-09T14:14:47Z","title":"Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06886","snapshot_observed_at":"2026-08-06T20:02:32.984728Z","title":"Aligning cyber space with physical world: A comprehensive survey on embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.984728Z"},"links":{"cited_paper":"/paper/2407.06886","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:323bb3928a6a0f30669484c3768e0be6407d2ad5cc68697f0c4b472ec5ab09ba","observation_id":"2d1902b8-80a2-4ddf-90eb-aa605a81c199","resolution":{"observed_at":"2026-08-06T20:02:32.984728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.291087Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":"5eb5faea-2f0b-4587-9caf-725a4e74d157","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.989899Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:a5c3849bfb7aed3ed33321de244aafc1382f0c6209964c58b12e1fd58271b0ac","observation_id":"c545085f-88f9-4e78-bb8c-50e4337486a6","resolution":{"observed_at":"2026-08-06T20:02:34.296444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.256455Z","title":"Zson: Zero-shot object-goal navigation using multimodal goal embeddings","venue":null,"work_id":"0951475b-54cd-4496-87b0-f584dbabcaa5","year":null},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.994814Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:ed18b8dd1c35522e8e52151d5a1719b68871df42110dfe87425e83ab8067825b","observation_id":"41653663-ad6f-4d35-8548-2f546cc1f18e","resolution":{"observed_at":"2026-08-06T20:02:34.280449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.178107Z","title":"Openeqa: Embodied question answering in the era of foun- dation models","venue":null,"work_id":"33ef26e2-f8a2-4b41-806e-1e7fe7e555aa","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:32.999861Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:63dcabb63ba978a08b7dcd3b6b2a1f1228aa274cd730753e5329bae5653954fb","observation_id":"e621b6db-fe2c-4a9d-8df8-dbfe3a847b75","resolution":{"observed_at":"2026-08-06T20:02:34.211271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.124372Z","title":"Openeqa: Embodied question answering in the era of foun- dation models","venue":null,"work_id":"ada04085-ed97-43ba-9263-cb671a0b00b5","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.005435Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:da893551ca87cd77b53541f00d6200464bf84bd0bbf31c9a0ecb8cd41e59af84","observation_id":"9b824185-5025-4395-aca8-665e709e9b42","resolution":{"observed_at":"2026-08-06T20:02:34.152079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.109732Z","title":"Spatial memory","venue":null,"work_id":"efcd65ee-96df-4458-be7f-f0d42825d597","year":1977},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.010136Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:adf928356d440a535c10ae4a6fcb124ab9957b789e5dac7871774849a171ce67","observation_id":"bb3fbf5b-e554-44e3-9818-b6a3b50163c3","resolution":{"observed_at":"2026-08-06T20:02:34.114012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T20:02:33.014670Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.014670Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:382ad3e8ddeb53853bc6d79721a537117f8f4ce5ad16b487f21a73d5a33147c7","observation_id":"6da5b11a-36a1-404a-b98c-a3b75be6c88e","resolution":{"observed_at":"2026-08-06T20:02:33.014670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.092974Z","title":"Teach: Task-driven embodied agents that chat","venue":null,"work_id":"1e788eee-0f52-4e19-a4da-b9392f0f0eb0","year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.019013Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:859fbc4d109ed7aeaba44cb646acac575267e1198faa5526eb1f3be0b854f6a0","observation_id":"729ec64a-1e53-4c9e-af84-67004af85111","resolution":{"observed_at":"2026-08-06T20:02:34.099440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.078508Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":"7665623f-88d8-44fe-a8b6-8b31c0fc2a4f","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.023557Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:0438f6f8e4da50d4bdf528cbffd7eda75cade52fd1e834c0731fd20358e39e7a","observation_id":"91e13b98-5db9-4a06-b856-b57512660a26","resolution":{"observed_at":"2026-08-06T20:02:34.082872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.062282Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"5875ff52-1e47-49e6-95be-cd73d53f8e60","year":2021},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.028017Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:9bfe02fa6b47d619438dd3ec87ebe807e167e52366a07171425ff2ec84eea67b","observation_id":"0bb53d3a-b4fb-4ce6-a6bd-76e809f22e22","resolution":{"observed_at":"2026-08-06T20:02:34.067457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.047429Z","title":"Pirlnav: Pretraining with imitation and rl finetuning for objectnav","venue":null,"work_id":"e3ad6a10-3410-4834-896c-a2b054fe1194","year":null},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.032520Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:cb8fabc87396ced414d6652bfc41a66864ee1cfd5f767d64aed611f603d1f335","observation_id":"8337e663-f1b0-4a05-9243-ec3752d2a8ee","resolution":{"observed_at":"2026-08-06T20:02:34.051867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.031961Z","title":"Sayplan: Ground- ing large language models using 3d scene graphs for scalable task planning","venue":null,"work_id":"e81f624b-6472-4a88-b64d-1837d451cf8c","year":null},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.037520Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:0b97a3abe69b1bbc93e717689152d0119ca82ee4165f1e4a1f119c2822caa744","observation_id":"738a7c9a-cb3b-4a08-b6fb-3f9a641194f3","resolution":{"observed_at":"2026-08-06T20:02:34.036765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15941","last_updated":"2024-07-07T19:40:31Z","snapshot_observed_at":"2026-08-07T02:26:46.173562Z","submitted_at":"2024-03-23T22:04:03Z","title":"Explore until Confident: Efficient Exploration for Embodied Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15941","snapshot_observed_at":"2026-08-06T20:02:33.042822Z","title":"Explore until confi- dent: Efficient exploration for embodied question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.042822Z"},"links":{"cited_paper":"/paper/2403.15941","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:96c88f90c04f54b6e5f66706e56ec58d0652733c4ad1b2d8fee76f3f4f560758","observation_id":"841e3bdb-4be8-4196-9e45-3ab0b52d98ca","resolution":{"observed_at":"2026-08-06T20:02:33.042822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:34.014186Z","title":"Language- grounded indoor 3d semantic segmentation in the wild","venue":null,"work_id":"19d5ab0c-9aa4-4b37-9d51-940b367a3403","year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.047240Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:d387c3fe01acc1f8dded949a5c6a55366686e2dabb58813f1e51214c1bcc0ede","observation_id":"2bd1b137-7252-436e-90e0-50c9dee394da","resolution":{"observed_at":"2026-08-06T20:02:34.019320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.997927Z","title":"Habitat: A plat- form for embodied ai research","venue":null,"work_id":"df56599a-1930-4c1a-a5e3-60272c5a3df4","year":2019},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.051322Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:0982230f22e43b3261dc712bb7abd27f65950fecd7e012687243a0d2ad36f565","observation_id":"acc76002-445d-4d6a-a6a7-d62271306133","resolution":{"observed_at":"2026-08-06T20:02:34.002845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T20:02:33.055692Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.055692Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:093dc6f68f37b458051c4c71441912df64c38bb9b957ef49e57b1955bd393cc0","observation_id":"7bc365d5-0260-4142-b6f4-cb24fdbc7afd","resolution":{"observed_at":"2026-08-06T20:02:33.055692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.982018Z","title":"Mask3d: Mask trans- former for 3d semantic instance segmentation","venue":null,"work_id":"64f8c760-d9ba-42b3-8ad2-cb11b2b61365","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.059795Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:54f8a6c8c271c800a746c1ff0ceb65238bc9ee5ebed4fa27234dad9901cd3f2d","observation_id":"46baae52-902b-4d3a-bb2d-173f6c84d29a","resolution":{"observed_at":"2026-08-06T20:02:33.987323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.966141Z","title":"Alfred: A benchmark for interpreting grounded instructions for everyday tasks","venue":null,"work_id":"d421b206-d188-41ce-b632-2b5c0b38e492","year":2020},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.064643Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:274db12b4fb45a95f117411739cfb572f2bd8a7ec321f8aa357a268e2a201a11","observation_id":"0a686420-7872-4d1c-a62c-54e40f39f5ea","resolution":{"observed_at":"2026-08-06T20:02:33.971219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.949915Z","title":"Llm-planner: Few-shot grounded planning for embodied agents with large language models","venue":null,"work_id":"4f093713-923a-47c6-8a14-65df18616c46","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.069207Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:fe527a63b5b9708baaf227b10da16890d03b7557691fca33599a6dafc97242cd","observation_id":"170add76-540e-4418-8d40-8792d0b32b8c","resolution":{"observed_at":"2026-08-06T20:02:33.954645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.073653Z","title":"Habitat 2.0: Training home assistants to rearrange their habitat","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.073653Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:d20d240e9788ddcb24fb3dd45fb607092e9e7fa989241e15be126c400b821241","observation_id":"9bf74e8c-1c66-4fcf-9d3e-71c08d19150b","resolution":{"observed_at":"2026-08-06T20:02:33.073653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.922475Z","title":"Sumner, Marc Pollefeys, Federico Tombari, and Francis Engelmann","venue":null,"work_id":"dbc18998-1bc0-4903-9f09-1d553fdd83f3","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.078435Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:5a07ec02dd7a40e35f06e71f678cbd1ae61bae3bc56a1ed125ebb2a5e2ecbd87","observation_id":"c9530d43-f3e2-4889-b87e-9045a8cd09d1","resolution":{"observed_at":"2026-08-06T20:02:33.927417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.907078Z","title":"Rio: 3d object instance re- localization in changing indoor environments","venue":null,"work_id":"055fb120-1ea6-41c1-b615-6a5a9561c454","year":2019},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.083330Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:d8a852ddf7d11ad53f6ce9fee2713b0ce3f739228482f4f244b65d48067c8652","observation_id":"c9361746-d768-4873-a170-e937b6194819","resolution":{"observed_at":"2026-08-06T20:02:33.911980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.890825Z","title":"Embodiedscan: A holistic multi- modal 3d perception suite towards embodied ai","venue":null,"work_id":"528c9a99-c7df-438e-aba4-5a97d5abea0f","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.088684Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:64e407488070ce33501a637f32e1cf29f6ed0a5c1b5807f35464dd8d40203d9a","observation_id":"c3958155-876a-4424-a8c8-c14914faa310","resolution":{"observed_at":"2026-08-06T20:02:33.895603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00357","last_updated":"2020-01-20T04:18:58Z","snapshot_observed_at":"2026-08-03T16:21:22.610677Z","submitted_at":"2019-11-01T13:07:37Z","title":"DD-PPO: Learning Near-Perfect PointGoal Navigators from 2.5 Billion Frames","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00357","snapshot_observed_at":"2026-08-06T20:02:33.094358Z","title":"Dd-ppo: Learning near-perfect pointgoal navigators from 2.5 billion frames","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.094358Z"},"links":{"cited_paper":"/paper/1911.00357","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:bd336fc6854368b5f57b62ab9e0509892865624ec87cf076ec18d92e02c4b64e","observation_id":"9840311b-3a6c-44c1-b628-fe68e2d051ac","resolution":{"observed_at":"2026-08-06T20:02:33.094358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.875508Z","title":"Ver: Scaling on- policy rl leads to the emergence of navigation in embodied rearrangement","venue":null,"work_id":"85238850-f3e1-498f-8c7b-69312b6aeb48","year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.099421Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:b929b905717182481b39ecbb5718af3cb1e0930803b121ceebfdf6125aba28f0","observation_id":"d855c8e7-24ce-4c92-bf00-1cde8f9bce5c","resolution":{"observed_at":"2026-08-06T20:02:33.880023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.860444Z","title":"Scenegraphfusion: Incre- mental 3d scene graph prediction from rgb-d sequences","venue":null,"work_id":"3469ca6d-fa0e-4802-847c-7d40542080fb","year":2021},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.103822Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:4b3af0abab59369c697b7b690a6a0ded9b95c4f0e7ce9be7b2326abf1238bc5f","observation_id":"c4dbf192-0e51-4d22-9090-66021d4bdc9b","resolution":{"observed_at":"2026-08-06T20:02:33.865248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11811","last_updated":"2025-02-12T05:16:17Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:57:06Z","title":"EmbodiedSAM: Online Segment Any 3D Thing in Real Time","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11811","snapshot_observed_at":"2026-08-06T20:02:33.108579Z","title":"Embodiedsam: Online segment any 3d thing in real time","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.108579Z"},"links":{"cited_paper":"/paper/2408.11811","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:dbff194bb0c29a9eef55ed235607960c68365595356ba971bb063658398c3332","observation_id":"73cebb80-6c31-4bd7-be82-84128aef8574","resolution":{"observed_at":"2026-08-06T20:02:33.108579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.845305Z","title":"Habitat-matterport 3d semantics dataset","venue":null,"work_id":"713fc755-e03d-429b-a436-8d90e53cc4ad","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.113772Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:f60c97c0883518c6e0ef9f487a20b9967bb6ed022aed1056f06c7344ccb72dee","observation_id":"8f204022-07ac-431f-b824-1607b07efda7","resolution":{"observed_at":"2026-08-06T20:02:33.850264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.830733Z","title":"Frontier-based exploration using multiple robots","venue":null,"work_id":"6e007051-fbd3-4328-94c3-591b998b30a5","year":1998},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.118819Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:c81316ba5bd1bc527b3387b34b5e41c11671a197aa9b35f198df27aa3921b53e","observation_id":"66540fd2-5ebc-42da-8a41-49a9ceb41a84","resolution":{"observed_at":"2026-08-06T20:02:33.835273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-06T20:02:33.123605Z","title":"Thinking in space: How mul- timodal large language models see, remember, and recall spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.123605Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:bd69f93d1eaa425d2cd914059f97d788b2198be1bbad83a3986338fef2f87ed6","observation_id":"1525a073-ef2b-44c6-bb44-cf0d9203795b","resolution":{"observed_at":"2026-08-06T20:02:33.123605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.815096Z","title":"3d-mem: 3d scene memory for embodied exploration and reasoning","venue":null,"work_id":"76b6a90f-c585-4b01-9ef0-bb7e29e40f30","year":2025},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.128531Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:c8037c04c838cd3dc04861d35d234386169f541ecdd0a9cc2fb4374a7cee6080","observation_id":"6b28ee52-6bb1-45e5-a211-0a0961a5e8fc","resolution":{"observed_at":"2026-08-06T20:02:33.819523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.799362Z","title":"Vlfm: Vision-language frontier maps for zero-shot semantic navigation","venue":null,"work_id":"85e39bb8-c267-46a5-af0a-1e65c4abdd9c","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.133341Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:310ef89651e83df76773ff4bfb454818a564dd123955785e08d5ec1907464645","observation_id":"f7902776-3426-4812-ba1d-835c3e02c367","resolution":{"observed_at":"2026-08-06T20:02:33.804490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.781576Z","title":"Hm3d-ovon: A dataset and bench- mark for open-vocabulary object goal navigation","venue":null,"work_id":"f73db1a8-026f-4f59-b7c5-d4ca600d357b","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.138214Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:2d29c56be198b9f3ab5a9d7a6f718867e261789efa5928628233fbaf6260f4c3","observation_id":"e846a639-0e12-4c7f-96d5-1bab80731938","resolution":{"observed_at":"2026-08-06T20:02:33.788045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.764807Z","title":"Frontier semantic exploration for visual target navigation","venue":null,"work_id":"8646af87-9661-4faa-aaa4-7050d77df109","year":null},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.142761Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:647cce5bc8c3c3f29c7f0a4d2b14246b299089ded9e15c1f5abe753d3c123b65","observation_id":"0e5784ad-8c37-4039-8d60-94a6b91f6d0e","resolution":{"observed_at":"2026-08-06T20:02:33.770186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.750239Z","title":"Instancere- fer: Cooperative holistic understanding for visual ground- ing on point clouds through instance multi-level contextual referring","venue":null,"work_id":"8998baef-e153-4ca9-b4d5-d7a65f245faa","year":2021},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.147218Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:806edc3b0d1ec487e940b0ca9f61dd8cd40897c6f6dc0d4e8c6199bc229f5a70","observation_id":"aae9a2f4-215d-4950-8a5f-1f54cf5c022c","resolution":{"observed_at":"2026-08-06T20:02:33.754549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20083","last_updated":"2024-06-28T17:51:10Z","snapshot_observed_at":"2026-07-06T18:38:38.104034Z","submitted_at":"2024-06-28T17:51:10Z","title":"PoliFormer: Scaling On-Policy RL with Transformers Results in Masterful Navigators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20083","snapshot_observed_at":"2026-08-06T20:02:33.151309Z","title":"Poliformer: Scaling on-policy rl with transformers results in masterful navigators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.151309Z"},"links":{"cited_paper":"/paper/2406.20083","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:c8ac5db696e3514585aa2e4ca9ea4906c780e959489ab55242dbd7efd1927d86","observation_id":"2609d05e-91ce-4d80-b285-5d697180c3b5","resolution":{"observed_at":"2026-08-06T20:02:33.151309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-08-06T17:32:08.916929Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06224","snapshot_observed_at":"2026-08-06T20:02:33.155998Z","title":"Uni-navid: A video-based vision- language-action model for unifying embodied navigation tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.155998Z"},"links":{"cited_paper":"/paper/2412.06224","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:e27546092f9b3024ae08c34fdb4f945d153cc9d59225a527dc8ea82ee6b61215","observation_id":"583e3afd-8e7f-47ef-9722-8da0e9f8a503","resolution":{"observed_at":"2026-08-06T20:02:33.155998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10714","last_updated":"2023-05-18T05:25:40Z","snapshot_observed_at":"2026-07-06T15:29:05.031168Z","submitted_at":"2023-05-18T05:25:40Z","title":"Vision-Language Pre-training with Object Contrastive Learning for 3D Scene Understanding","version":1},"cited_work":{"arxiv_id":"2305.10714","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.10714","snapshot_observed_at":"2026-08-06T20:02:33.327427Z","title":"Vision-Language Pre-training with Object Contrastive Learning for 3D Scene Understanding","venue":"cs.CV","work_id":"f300b264-c085-495c-989f-d0b1524a419d","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.160598Z"},"links":{"cited_paper":"/paper/2305.10714","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:6f030e72770e3d8f44983e0f64b17d6911a73d7f9626f53dfb6d8dbc973b46b0","observation_id":"6063f092-66ec-41ba-84c4-cb0f6f1045a0","resolution":{"observed_at":"2026-08-06T20:02:33.334560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.735417Z","title":"Multi3drefer: Grounding text description to multiple 3d objects","venue":null,"work_id":"b7135663-f688-420e-8057-e2677c319d81","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.165673Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:ae68f284c327d8191be57a1c8ff71b8894daf114949feaa229d501ea428c7710","observation_id":"5f9780c8-10d5-4986-8f9a-4d97c8147ca9","resolution":{"observed_at":"2026-08-06T20:02:33.740367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.719084Z","title":"Microsoft kinect sensor and its effect","venue":null,"work_id":"a450e5b3-0dc6-47a6-9db4-835248e19082","year":2012},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.170543Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:0605e761717eb9fcba4a7f7d6f370c9a33339289b080639d38378b6412242c27","observation_id":"f7906a49-1d19-4666-ad00-b2842a1db9ca","resolution":{"observed_at":"2026-08-06T20:02:33.723322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04034","last_updated":"2025-03-08T01:37:47Z","snapshot_observed_at":"2026-08-03T22:29:46.696330Z","submitted_at":"2024-08-07T18:30:18Z","title":"Task-oriented Sequential Grounding and Navigation in 3D Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04034","snapshot_observed_at":"2026-08-06T20:02:33.174687Z","title":"Task-oriented sequen- tial grounding and navigation in 3d scenes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.174687Z"},"links":{"cited_paper":"/paper/2408.04034","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:a949e5fcfac252f7cf55b2fb5a8a5a1147cb4645e5111f591e80259bc0ccb8fb","observation_id":"f7fba5c5-b1d6-49a2-a672-f6d67140bc4e","resolution":{"observed_at":"2026-08-06T20:02:33.174687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.702844Z","title":"To- wards explainable 3d grounded visual question answering: A new benchmark and strong baseline","venue":null,"work_id":"ed853e0b-c9b1-47c3-9411-1eb707b5ad64","year":2022},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.179080Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:898766c5e7d35c65a961be39889b5332b4a8d2f85907dd34d56ead266d7662ce","observation_id":"b0f133cb-4108-4947-b1fc-836c269d090e","resolution":{"observed_at":"2026-08-06T20:02:33.708124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12156","last_updated":"2023-06-21T10:08:29Z","snapshot_observed_at":"2026-07-06T15:45:01.961896Z","submitted_at":"2023-06-21T10:08:29Z","title":"Fast Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12156","snapshot_observed_at":"2026-08-06T20:02:33.183289Z","title":"Fast segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.183289Z"},"links":{"cited_paper":"/paper/2306.12156","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:625da61884f2c410210d970e8eae728c46bc897dd5f092b77edf7d994f42279b","observation_id":"a10528fa-1096-4e34-adf2-8d1bfbaa1104","resolution":{"observed_at":"2026-08-06T20:02:33.183289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-05T20:54:58.855446Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-06T20:02:33.187976Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.187976Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:7d0f9a13e8d54d58b9cfd82a421784481ebecc0a8605c0704ff017199a01c131","observation_id":"c0dbc718-15b3-4fef-ba94-993a9eaf9604","resolution":{"observed_at":"2026-08-06T20:02:33.187976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.686564Z","title":"Dual memory units with uncertainty regulation for weakly supervised video anomaly detection","venue":null,"work_id":"5a32577b-9ab5-4538-b3ab-81552967977b","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.193178Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:d5d664650ff49058eb1f22e78caa92f9df8182fd661704ab8e0ddba1fc0e6f53","observation_id":"83388a1b-427e-42dd-a5f5-0aa425a01d7c","resolution":{"observed_at":"2026-08-06T20:02:33.690761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.671242Z","title":"Scanreason: Empowering 3d visual grounding with reasoning capabilities","venue":null,"work_id":"8ae8ad39-8b3a-4de9-901b-8496fb3e3f9c","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.197976Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:2628a216c64f5e3258f51bdc24a9df8a9adb34b93b4c315a9c40948cea8e04fc","observation_id":"96ec4986-1805-49e8-ad9c-1def13a40b0b","resolution":{"observed_at":"2026-08-06T20:02:33.676105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.655021Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":"fec06f34-28b0-4dfb-a42c-7fbd57196606","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.202562Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:490a722aeaf3956d7484e24c2a05f09d084f69904b035184fbeacd13c53c987e","observation_id":"d4465aff-60cc-4572-b653-dfdb711f5ee1","resolution":{"observed_at":"2026-08-06T20:02:33.660133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.639535Z","title":"Unifying 3d vision-language understanding via prompt- able queries","venue":null,"work_id":"c5d2eba3-1f49-4488-96fb-56f5b87e410f","year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.206561Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:342f0701385b33be18bc7eaf05a38d292be70d1b1b828e1d4db5896fc221dd7a","observation_id":"225f2ccb-d3ce-4433-9dbc-f8934a0e1169","resolution":{"observed_at":"2026-08-06T20:02:33.644142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10402","last_updated":"2024-12-05T21:52:20Z","snapshot_observed_at":"2026-08-05T15:17:25.165764Z","submitted_at":"2024-12-05T21:52:20Z","title":"TANGO: Training-free Embodied AI Agents for Open-world Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10402","snapshot_observed_at":"2026-08-06T20:02:33.210895Z","title":"Tango: Training-free embodied ai agents for open-world tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.210895Z"},"links":{"cited_paper":"/paper/2412.10402","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:e5720a73d5934c7e665d12acb632175a7b25b9eaf53386cf15d68d269318feef","observation_id":"17a85cb1-9423-4a72-994e-4fc5374ca733","resolution":{"observed_at":"2026-08-06T20:02:33.210895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:02:33.623543Z","title":"Generalized decoding for pixel, image, and language","venue":null,"work_id":"f3c52909-a0d7-406f-bcb7-5a092dcebdf2","year":2023},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.215747Z"},"links":{"citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:3c60591b135c4f890d7ee0c08ac1c56cf72fc1171835315fcf4460fd591e048d","observation_id":"be143c56-3127-4de0-84c2-0274233b3c85","resolution":{"observed_at":"2026-08-06T20:02:33.628398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T16:52:14.939489Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":59},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 2 inbound Pith citation observations for arXiv:2507.04047."}