{"as_of":"2026-08-22T06:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ee98ffe4aa1a943c98cfb6bc4ac73fa4eab0c64d536bffd77b4805bba60c1cf4","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T18:21:18.475105Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.26500/citation-record","integrity":"/paper/2605.26500/integrity","json":"/paper/2605.26500/citation-record.json","paper":"/paper/2605.26500"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Bevbert: Multimodal map pre-training for language-guided navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:cb2e5c0307ce45cea7378164bf708de797eb864ba54a3b991ce63e5c9d636f7f","observation_id":"8308f7a8-7ac7-4cc0-8bad-2fd3e86cbf5b","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Etpnav: Evolving topo- logical planning for vision-language navigation in continu- ous environments.IEEE TPAMI, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:a28267a3e6414bfba8b3ce91032f2ba718aca85b524eb08caecf308fa93e4e0f","observation_id":"d1200a19-6589-4e2a-9a89-8604a3e59b31","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Reid, Stephen Gould, and Anton van den Hengel","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:63e38490e8a22691d11a562da29bb679ff16a3cc9375802143d688275539f441","observation_id":"0cc48786-e186-45f1-8784-b01d20276ce6","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"3d semantic parsing of large-scale indoor spaces","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:d94bfd3d8e0ff7887dfeecd78393f53e375674d189aaa17c81be2ce212e5ea1e","observation_id":"3a18e11a-f9f9-436a-9984-213991c494ac","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Matterport3d: Learning from rgb-d data in indoor environments","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:49e24f5ce8c06179c06d80b9fb021fc8bb9850cb261e4f5f3f5e58f297ffcd84","observation_id":"80cf65e6-00b1-4b33-b1ed-c8b9e1ce3fb3","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Object goal naviga- tion using goal-oriented semantic exploration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:ba8bf45e0e3f5516ae9ad9192feae664b1d710bc4c7293630b24a9b047dd9a9a","observation_id":"9af4a82a-0af9-4010-bc5c-af23ac89eb72","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Neural topological slam for vi- sual navigation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:22aa097491be9760ca0f313cb8731903ece7f0f07b6ad35d9bfdc0d3173924cc","observation_id":"c03b04bf-92e2-43cb-a32a-b54b0494a38b","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"pixelsplat: 3d gaussian splats from image pairs for scalable generalizable 3d reconstruction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:e8274f9fb88ac521abb79bab16755f9e838350314cf5cddc5798338af5a1d257","observation_id":"c0d74a32-f383-4c4c-b8b5-40a21fa71cc6","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03890","last_updated":"2026-04-09T05:33:48Z","snapshot_observed_at":"2026-08-09T09:22:22.467803Z","submitted_at":"2024-01-08T13:42:59Z","title":"A Survey on 3D Gaussian Splatting","version":9},"cited_work":{"arxiv_id":"2401.03890","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.03890","snapshot_observed_at":"2026-07-04T19:50:10.232104Z","title":"A Survey on 3D Gaussian Splatting","venue":"cs.CV","work_id":"2973d36c-ccde-4a37-b764-2e5fb6f473f1","year":2024},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"cited_paper":"/paper/2401.03890","citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:31d4f48d275d0972b903f89fa74c824b897bd3232434213bd493ea4649f6db43","observation_id":"9949e942-3d08-47f5-a9cf-d6ff7d6b75de","resolution":{"observed_at":"2026-06-29T18:23:50.613597Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Learning active camera for multi-object navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:567e2932e9ad1ff89921fe2a8b159edfbb34821ba220eaa534634adcccc56829","observation_id":"56b6b7d8-b64b-440a-b350-07222e87fa29","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Weakly- supervised multi-granularity map learning for vision-and- language navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:dfc8d7fd41d739e3e73d6788c1abb392265c8956b30de50716453c0e4d848e96","observation_id":"e455f297-c7f9-4504-9df4-0062c87b4672","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"History aware multimodal transformer for vision-and-language navigation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:22d433ca36f0d4eb67444539a946bc3b8cec6437a260c6b072ac2c783b959b5c","observation_id":"42cfafe3-28e8-4bef-bc93-28cfb175c4c7","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Think global, act local: Dual-scale graph transformer for vision-and-language navi- gation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:1dc765397d7ec0f74b1136b6adabe46f1ce8b13036fbdb2acfe449d697a0934c","observation_id":"246297b1-ea35-4fab-8f66-324d4b526fff","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Text-to-3d using gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:57b422e21d995bb569c8676b16c20f476443040d3271eda80a7eea9508fa2902","observation_id":"a9b3c51b-8ac0-490a-8cef-6fba3b4f323a","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:468bd2bc063181e8199c97244d6f1909caf65bd4a73d1ddb1d7a44d04707f953","observation_id":"c6251885-d403-4b7c-a52d-380537f6b5d7","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Evolving graphical planner: Contextual global planning for vision-and-language navigation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:ead943bd59239e91212e7e83f8b3008f32a6f4c8436ab7b7f028f5a154df24c6","observation_id":"ae774b99-5541-4ecb-979e-581a0ee720d1","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Unconstrained scene generation with locally conditioned radiance fields","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:ff4e242e5dcc1716c192942efee7befee5d81e53b29f648449c730734258cfac","observation_id":"78ccdae6-8676-4590-ac4f-e564730ac90b","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Reinforcement learning with neural ra- diance fields","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:8a42475fc55732e9ac9bc7ccb0abaa2ec678e59ac60e531fc9e54970f525eaa9","observation_id":"f02c6fcd-b2ae-4c26-81a7-d6191afec65b","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Evidential active recognition: Intelligent and prudent open-world embodied perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:dfebad0356c6e708712ebea90f82c26a35ad198351e57ae231b6a3e99d5cc7a0","observation_id":"9aff3430-2c9e-497c-8423-57b5df345ef1","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Navi- gation instruction generation with bev perception and large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:5dca206dd73f7c39596b30c6b0bc9c478a78d1b2022d3edadc88efabfe5e742f","observation_id":"58df7574-bc5c-43f9-af38-5ebfc4e789ec","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Scene map-based prompt tuning for navigation instruction genera- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:83815c25680541e85622567d2049252065ca874f7572ae7c616b61d850d85dbe","observation_id":"029f7ce4-a075-4cba-928d-0c6ade433dda","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Speaker-follower models for vision-and-language naviga- tion","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:ae3f786ed4eb8e602717c2b6c1c469c16daf52d5fcae445914573d73213d40c1","observation_id":"33592cfc-f5f1-428c-959e-2e46888f0f3b","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Panoptic nerf: 3d-to-2d label transfer for panoptic urban scene segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:f0f96d1b4b6c9e2d6577d4589d6a061f5048dce65709c855aea267148ad8a1ad","observation_id":"8d70fb94-3df5-43dc-bed6-970689175c5e","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Dynamic view synthesis from dynamic monocular video","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:fda00d1a9768d116b2b13838e21fe8f23e72820d517d813d94c6a20d62f58a9c","observation_id":"bd70849e-6ad8-4f2b-9ed4-1277a228bb4a","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Room-object entity prompting and reasoning for embodied referring expression.IEEE TPAMI, 46(2):994– 1010, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:3a3e14a95d4dbbfd627ce5e4b402297229b30cdc7a0caf7b5653559e3e8ace6b","observation_id":"aefe504e-a80b-4f10-9608-def9dfc64b04","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Cross-modal map learning for vision and language navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:cb9c85f347dd1075b4e994f1fd37e0933bb150a492c4e158456e06651e929d76","observation_id":"32b62103-2834-4ab0-956d-9a36f6d9c8cc","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Airbert: In-domain pretrain- ing for vision-and-language navigation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:ce7d0c680bbb27a479454ff806ce3800b13b4bc8e9a0ac28ee21462b7cd73433","observation_id":"474fa3a9-43c1-4f5d-b37e-25a59a16b1b3","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Multi-view reconstruction via sfm-guided monocular depth estimation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:fc3cbc1f8038fbc1f18cdd466a17efdd4f61d2429ab9196a2e05ed6788694b53","observation_id":"65ac717c-b9f2-43d4-90a4-a6056b44874b","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Language and visual entity relationship graph for agent navigation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:03038befe63c33c2ab813ea9a77da72d3091b8cc5244007ebab3bef62c29d5e3","observation_id":"80c66e76-f22f-4749-930e-0abb550a1d04","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Vln bert: A recurrent vision- and-language bert for navigation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:7835f0140499f01a93d60b681bfe1ebbbb05c521428633d3103a3d95b4acd801","observation_id":"4d8af440-16e8-4388-b74a-01534cc687d5","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Learning navigational visual representations with semantic map super- vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:910c2315a81a4d47c96f25bbee004d35cc979d663ca7bb7830c6cc75f7da98e4","observation_id":"35b53c0e-25a1-43ac-bcc8-cbb71c506d44","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Stay on the path: Instruction fidelity in vision-and-language navigation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:cea8d50cb365c774b5ffd75b2026c484b31778b3117e95dc835f4c16c2169ba7","observation_id":"e50662a6-048d-42ec-97c2-367a34933241","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Hifi4g: High-fidelity human performance rendering via compact gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:d683823e8aa8fdabfae23a8ca299bc741c300eeb99149e17fd8d5fe158e8caa0","observation_id":"cf836c5a-bcdd-4519-933f-8500cc73a67b","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Deformation and correspondence aware un- supervised synthetic-to-real scene flow estimation for point clouds","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:44baf94855b93b0d062af98d5e3e0e0522a0b875c879092a94e9feba4b81c3db","observation_id":"c785602c-dd0e-4d42-a87d-4413146abe0d","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Splatam: Splat track & map 3d gaussians for dense rgb-d slam","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:dfa3390e205a701f58b330e847ece453f2db543c12d37d7294a90f9bf0519537","observation_id":"a922c9d9-a6b0-4fa8-8987-3e8eba12391c","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:2480bc672955cb6342fdfc45fc60ed399aa98377b559cc03e18b24fc036e9a2f","observation_id":"f8bc45f8-fa7f-400d-b7ae-3a85fd0a5c2f","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"3d gaussian splatting for real-time radiance field rendering.ACM TOG, 42(4), 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:976a97efbb2ead019f4e4db1e984df8bdb3ec59a4829cf03d6d09099e18b37fd","observation_id":"709cad3e-611a-4da0-90dc-304fe95a99b5","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:28cbb100d3de4fcbbeb8341f87e27250763058ee6d3367412857360dee938bdc","observation_id":"82bb6540-9bce-4e69-9f82-7c04c53ef4fb","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Controllable navigation in- struction generation with chain of thought prompting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:7e14e17021165034f19afe3bdcd622041879511bba4a542e9a074f647f16876e","observation_id":"5bd35366-ce58-45db-809e-c35f6c48048a","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Renderable neural radiance map for visual navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:80162c9a25926e061ee82fd96cfebf43a36e5b28e12be5fa923668eeb5bce1ed","observation_id":"c33b45f8-8656-4582-892a-cdc48a610aa5","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Envedit: Environment editing for vision-and-language navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:988388bf62e0f200e77afa4f0c79e6ef19e046e6169f195c1c24cfe2fe6e474f","observation_id":"9fa95f73-feb0-4dc3-af68-7503cc07569e","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"3d neural scene representations for visuomotor control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:d293763a871acb2d5281347d0179196569dd884f0de8523ab102fb8559068568","observation_id":"70857a6a-9260-47ef-9b44-386f046fe834","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"V oxformer: Sparse voxel transformer for camera- based 3d semantic scene completion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:c9dcb9bace2981ad67bda835313f006e2b35a300a264b8154c9fecffb9f2835f","observation_id":"20315b3c-d6e2-4a61-9cd9-4869e654e450","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Luciddreamer: Towards high- fidelity text-to-3d generation via interval score matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:fe2d3b7e0dcab81cb6cc98dc0e7555f6c9d2296a51e2b652e1e893d2578bcad9","observation_id":"b34ea2b8-1cd4-4fb2-9dce-a54d292d414b","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Scene-intuitive agent for remote embodied visual grounding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:1e444233dc1711c24b8e8e30549f895fb3fd37eee5b45820e2a924e8ca2e8aac","observation_id":"2c627795-43d4-40c0-ab2c-b744af895fb7","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Vision-language naviga- tion with random environmental mixup","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:575e7fa73944bc06ee391f5da30e3fbb847024f8b4b004684486702ac4caf0fb","observation_id":"6b3bd8e0-03ee-4d2c-9b11-9c203080b681","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Bird’s-eye-view scene graph for vision-language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:1129bc27f60666ac4ca8f1cb074d55ac0760cb8753f9444c66336bcf94a0b242","observation_id":"d7045f83-e1cb-4a08-a7af-2e01f07d5c0d","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Vision-language nav- igation with energy-based policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:817cb9b457365d1132544b2a9294fff9a1f7b921c1c4e5b4c1e1d18da6486c09","observation_id":"bd6b843a-914a-4fa2-bf0e-e4950741b64b","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"V olumetric envi- ronment representation for vision-language navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:88e297398fb6ae518db652ad9a0c93a835c9a3f5031f6ffab8877d49a4cddfaa","observation_id":"23df8aac-b14d-4c8c-a0a6-beeb56760cbf","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Editing conditional radiance fields","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:a8d01d84ccc68d09d8ac647f2e06ec24e166752e58e730ee98d7c9dadffe1d3f","observation_id":"ad3f74c1-5a1a-4055-bd99-629401d412ff","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Srinivasan, Matthew Tancik, Jonathan T","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:5e262239d0cfcecb8c0cdeeadea79f2258820316161cb2caa0634c2603a95788","observation_id":"f56b006f-6ebd-4220-b806-288f41409ade","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Soat: A scene-and object-aware transformer for vision-and-language navigation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:b4f1e5b459f6e21c2ecce63806e7fe0dae8eadf6cdf3ed0d9845346da478e07b","observation_id":"a88d7427-87b6-44a6-b7ca-3512bb74b80d","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Seeing the un-scene: Learning amodal semantic maps for room navigation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:6a592effcf8c375080e0f83da1c2351474ae6e0a8899bd835285b4a9e9bf7b21","observation_id":"c398176c-2e08-46b9-81f8-6d547f40db7d","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Neural map: Structured memory for deep reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:a4977cc32b05d2dd9393c03c076e4c3c0ce4c605893de8308a577bfa5b147d8a","observation_id":"33345515-4949-4edb-a7d3-b637efb77c90","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"D-nerf: Neural radiance fields for dynamic scenes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:799a99ffa320c5168fb042e1f76ab7e7edc27dfb8a2d553a62efd7822641f01d","observation_id":"b99a6570-a09b-49f7-b73b-709fbc69ec4a","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Reverie: Remote embodied visual referring expres- sion in real indoor environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:541503af39e819f03a2bdb8897279b7a251a3f04de6fac9358a7ce8a33abc224","observation_id":"9c7128cf-e41c-4023-b886-9cb5aa394734","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Hop: history-and-order aware pre- training for vision-and-language navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:b00f27240d8d98e11cfecdb4c0c66e947129ffa1fe36c30b6247365decb6a112","observation_id":"781744d9-02b4-42ba-b02b-8074e3608030","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Holis- tic lstm for pedestrian trajectory prediction.IEEE TIP, 30: 3229–3239, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:9de9e0e40c2f8f5b6406bd9e228267cf3f80979884feb20da1f202d728b73ba7","observation_id":"5f85be6f-b2fb-42b9-bbb3-6ed40583551f","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:eeec961a293ed8e62c3152720288995e23e1ff4718a1c4cb7beca04f62389a2b","observation_id":"8823f0b0-d875-4d42-aea0-79d9e0e8598a","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Occupancy anticipation for efficient exploration and navigation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:90f47a19f345d50a7c828a3f0f16f497e2acda4dc739742e883388db81cb262d","observation_id":"dc4408a4-7e89-4ab0-a42c-fe11de67f07f","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:e04b1d8ed5299b703d3c50b525b334ccfaf111b06a0c6c542f61cd2c02f4cd11","observation_id":"8664526a-3c59-4511-8b11-b1315763b04e","resolution":{"observed_at":"2026-06-29T18:23:50.610305Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Gordon, and Drew Bagnell","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:e18d9e2fe79dacc7256bea66705eee9f1929b83ad1706dbec29779a560a88649","observation_id":"5cfb5b44-428a-4d87-9d8d-2101a184cb3b","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Toward open set recogni- tion.IEEE TPAMI, 35(7):1757–1772, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:2f08037c9b9fe73eea8f57cd9aac5ac9a9836f1a38ed5d0d0de6b06def6fbeb1","observation_id":"42f07a43-6742-4dcc-bfba-56ab4f0d9a02","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Language embedded 3d gaussians for open- vocabulary scene understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:52b3315974c44060f13edd7ee10af86b236195d934a7d4eb1680c9cec9d6a311","observation_id":"90dccd76-63fa-4c82-b738-344a62707d90","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Snerl: Semantic-aware neural radiance fields for reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:3326643809e465a1b0f8bcc756d677678b468c26a80da56b5ebac2d6b0e5525e","observation_id":"8596cd39-fece-494a-b34c-7313c69a5ed5","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Sequence to sequence learning with neural networks","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:f08f86be7f937069bbaead83142d66351b9b704b799f1bc44a7b8e0c2de12c69","observation_id":"3d3b2322-b260-4706-85ae-4024d7ced8d9","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Learning to nav- igate unseen environments: Back translation with environ- mental dropout","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:440965bec64bc2091577d2c82fa11f64d784f5e595f74b84f1e2210d7bc1a7cd","observation_id":"7f0a9d19-d824-48f6-9410-c1952e86f7bf","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Active visual information gathering for vision-language navigation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:57c75d75fd7e8bc072aa1f4a190b6b677ae29afd7c4f9b5df0706717251a60bc","observation_id":"28020d93-299d-44a5-9908-c66dce421096","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Structured scene memory for vision- language navigation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:88bf7cbcba76f93c56e266d3fe72dd77b1b390eb141c9319ab89f417b5e2c2a2","observation_id":"27c03164-09c3-4f42-863b-cee9c4fe1b79","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Towards versatile embodied navigation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:cb93aafa231a94208945e49fe4e5e772aa13fadea39d0468ce1c449ee10318d5","observation_id":"eecf4612-81ae-4214-9b57-a20b6e9adf0f","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Counterfactual cycle-consistent learn- ing for instruction following and generation in vision- language navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:7ca270a88346f1059f54d7d191a2baf270621afdd81f67b9309d1da5fe5b06d3","observation_id":"de14de4f-d171-4176-b7d3-9234a04e97b7","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:d9e6cb7a2875886b00739268de4de4b717a0996a1778854908081ace52788f11","observation_id":"16c96448-9905-4303-a345-94128a03914e","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Active perception for visual-language navigation.IJCV, 131(3):607–625, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:fcc9cff9532287ca847168475dccd03f65f6293ad82b2e358a3db524e6eff73b","observation_id":"58412a53-9722-4e8c-88ed-98cf3965b4b3","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Reinforced cross-modal matching and self- supervised imitation learning for vision-language navigation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:7edbec25682fd2e2970a44046f28d553a1c1d783145716390bf5544fb48b0f3a","observation_id":"26840858-5036-46d7-84d0-f067b17809a6","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Lana: A language-capable navigator for instruction follow- ing and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:193d6d0d8a08b900f30dbf7df3b1636626897959bcf9fa3c31729bda3eeab2ca","observation_id":"8ae485e1-8fe1-4ba2-8bbc-20f9861ca2ad","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Image quality assessment: from error visibility to structural similarity.IEEE TIP, 13(4):600–612, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:03e3dc60e9c492cc1e34e517efb3627f5c435818d02748768fc7cf19d0509a30","observation_id":"67ecf29e-d35e-4f3f-9a52-8bd828fa678e","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Gridmm: Grid memory map for vision-and- language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:d4a6b0b2afd980dc581c0dee9005457cfc8c8722e4235114e548c0080b7d6cb3","observation_id":"2878fbc9-d2b6-41df-a9d5-fcea5e0df168","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Lookahead exploration with neural radiance representation for continuous vision- language navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:95b82dc10cdf1ce5a88b61eb5998fa1a62c0e19c534d82e00f42bcbc1a61fb03","observation_id":"66eeba34-0bdd-457e-87e2-f286de6ee3fa","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Vector-decomposed disentanglement for domain- invariant object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:cb0b3f889aa661d37900d76b098eaedc99b4640b0333fe109d1e9d396e7b0b3a","observation_id":"43ab28b0-3bd5-42fd-88c7-96d4a7b34eb8","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"4k4d: Real-time 4d view synthesis at 4k resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:866587e9c15d98f26fbe5fe0181315e0b7126e1df34de8f3a12eb200cfabb02b","observation_id":"02964bbf-4474-4f88-8b11-938472e68ea6","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Gaussian grouping: Segment and edit anything in 3d scenes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:b47e5a8632149c038593dea32cd5c4847a4eec8a01f5b2fdd0d43dce47ee83ce","observation_id":"345f004a-7b5b-4e44-adbe-0898ba2ee4e0","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Compositional scene representation learning via reconstruc- tion: A survey.IEEE TPAMI, 45(10):11540–11560, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:618dab648b0b14a16e3324a1912afc0f2e2613b633dfbb1ea43ba349d5016ec4","observation_id":"7d9a1962-663c-4dc7-94a5-731125395c51","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Target- driven structured transformer planner for vision-language navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:bcefff8bec73be3153befe6eb9e9c4184de407033fbce8a55c460f36297f7fee","observation_id":"b617152c-97e2-4703-b3d5-9b728202cffd","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"In-place scene labelling and understanding with implicit scene representation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:b53799f840c0f1311bd3bb62c4c39c46f8b93926cdc7e9e987e3faa98f1295e5","observation_id":"b6f58505-6981-4da5-8908-8547c64f6d86","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Empowering embodied visual tracking with visual foundation models and offline rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:2ef1de395532b04eaa32792d4c0d7b04869156140840588e741d54e21c5cbd12","observation_id":"f0277453-a614-4d23-9874-cfe84e38f9b3","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Unrealzoo: Enriching photo- realistic virtual worlds for embodied ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:5c70db5dd72a03468e53c919c651710f2c8238a19ef9105119304d97edd8a3a1","observation_id":"ee42e9a5-f17c-469f-af8e-10b5de0c6b55","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Migc: Multi-instance generation controller for text-to-image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:b3d66a73edbbc9c93d37ba4da99adc4ce927f87add5ff68af9f71a0e4c7edc26","observation_id":"30cb1c68-12db-47e0-b261-e4f1077228ba","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Hugs: Holistic urban 3d scene understanding via gaus- sian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:36434618dbfea6fb9ca1890c5faa602725d8609ed4324f50661b9329de9bbe1d","observation_id":"983f84d5-90b9-4cd7-ace3-33628d0ffa48","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Feature 3dgs: Supercharging 3d gaussian splatting to enable distilled feature fields","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:042d6b4d1e8249e8a321baf06b9e6ec93be37447a3ece3690496879098b28662","observation_id":"cbd7edbc-8b35-420a-b1b3-0dccb378d5d2","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:21:18.475105Z","title":"Vision-language navigation with self-supervised auxiliary reasoning tasks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-29T18:21:18.475105Z"},"links":{"citing_paper":"/paper/2605.26500"},"observation_digest":"sha256:62866c58809a3f77b7afa5b9a8c44efe5b4e16f84dc1e666febc9dad8bad7129","observation_id":"45430512-0a20-42cd-b94f-4544038764b2","resolution":{"observed_at":"2026-06-29T18:21:18.475105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.26500","last_updated":"2026-05-26T03:25:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T21:04:29.255023Z","submitted_at":"2026-05-26T03:25:49Z","title":"3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":88,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 0 inbound Pith citation observations for arXiv:2605.26500."}