{"as_of":"2026-08-13T10:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d1c4cdc605cc557797b09ceacec591bf798ea253aa0e00f979f1d76053738bd","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:41:12.121854Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.17030/citation-record","integrity":"/paper/2411.17030/integrity","json":"/paper/2411.17030/citation-record.json","paper":"/paper/2411.17030"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.994543Z","title":"Bevbert: Multimodal map pre-training for language-guided navigation","venue":null,"work_id":"fb124f66-02ef-412f-91a5-bf952d4d38b1","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.872337Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:efe98c1a4c6c80fa5cc0a1ff9930f80e6fdf8642ed02c21d419bdf00cb5df684","observation_id":"87a76538-db03-4cf3-9019-3a399722a007","resolution":{"observed_at":"2026-08-12T12:41:12.998682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.983161Z","title":"Etpnav: Evolving topo- logical planning for vision-language navigation in continuous environments","venue":null,"work_id":"10398f42-73c1-4184-bd6a-cdc49effe87d","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.876375Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:86cb0d5bf9f6a95d8fe1cc1932e0c535d478c2fa71ccd13a3fa85db86f1439fc","observation_id":"f1347bfa-b0b5-45a9-a855-7036e6eb5aab","resolution":{"observed_at":"2026-08-12T12:41:12.986898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:11.879942Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.879942Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:bc495b21b77a44a6a86a579a4a18e2b7a1b8e993de2b664b49b6cffe753747ce","observation_id":"4011b6c3-a942-4e00-9a57-48c24476a8e8","resolution":{"observed_at":"2026-08-12T12:41:11.879942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.967106Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"aa1e9b40-9f70-499f-a131-140a9e4030f3","year":2022},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.883947Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:c94efabf3f82336821c5911cf3fef4475fc46c6c1b885279a78a077f6c1f5e42","observation_id":"e22bb210-cc39-45d2-a090-9f82370aeffd","resolution":{"observed_at":"2026-08-12T12:41:12.970597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.956898Z","title":"Matterport3d: Learning from rgb-d data in indoor environments","venue":null,"work_id":"9156e0ac-a058-4b3e-818e-330fac7f9d96","year":2017},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.887606Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:11b42a7da37849aa9e3339e40d52e6932e562996b7000fd8102931964740e7f4","observation_id":"82a71666-756a-4d72-ab5c-0c9a3acaae83","resolution":{"observed_at":"2026-08-12T12:41:12.960308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.946547Z","title":"Object goal navigation using goal-oriented semantic exploration","venue":null,"work_id":"4e46539f-35c0-4b1f-9498-c542707a307b","year":2020},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.891276Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:35d1cecdf78ab7306045c1a925b49cae30376d49dd0d643939fe1461b431ac80","observation_id":"231eda7a-b2a6-41d2-8a83-027011731b0c","resolution":{"observed_at":"2026-08-12T12:41:12.950337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.935863Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":"1f979646-41c2-4795-9429-8e37e4cad9d9","year":2020},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.895050Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:9720e7234913802dae024d03b1e74430ebd83ecbf259413ebcc3dc575e8e7dec","observation_id":"b8969db9-f9b6-4a6c-9882-b91b6b68fba7","resolution":{"observed_at":"2026-08-12T12:41:12.939810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.925544Z","title":"Weakly- supervised multi-granularity map learning for vision-and- language navigation","venue":null,"work_id":"f6849de5-8838-4f62-8734-d2af59d21c99","year":2022},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.898655Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:6e74c06c92cdc51aee6decb0f384efb6eb26c512f801131cd43f0b3d35c88605","observation_id":"08e26698-f732-412f-b8db-f817edb853fb","resolution":{"observed_at":"2026-08-12T12:41:12.929169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.914258Z","title":"History aware multimodal transformer for vision- and-language navigation","venue":null,"work_id":"7083c952-0b63-4a10-85c2-915e5820494b","year":2021},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.901828Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:36aa52b1c82db61bf4ce746d3dedb35fa53fff5417c2cf2908d0f7cd9ffdee03","observation_id":"c13ec763-50d5-4cf2-9c2b-5672480a839f","resolution":{"observed_at":"2026-08-12T12:41:12.918415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.902646Z","title":"Think global, act lo- cal: Dual-scale graph transformer for vision-and-language navigation","venue":null,"work_id":"a005030d-f81f-4e60-8afb-ec6c7cbb190b","year":2022},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.905101Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:af477c29f2e4e27090bbc49c6b3908320a8a8889b75102ec0bab88c87f79eda5","observation_id":"2fdb889f-afea-430b-bf38-2bb66f3dd500","resolution":{"observed_at":"2026-08-12T12:41:12.906552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-13T00:05:34.358839Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-12T12:41:11.908299Z","title":"Grounded 3d-llm with referent tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.908299Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:14d800219672088a7ec003ceeef81fc1e4e33e635fb63fd4bc009a3f5fef9f4b","observation_id":"d395aad0-111f-4b6a-8f98-b241d1e41279","resolution":{"observed_at":"2026-08-12T12:41:11.908299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.892037Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":"9aa04336-a5c8-4291-aeef-22ecb9d345d5","year":2017},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.912314Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:a5d1df383de3b3c1ba640ef6925d622fe6103a276fd5ac764c23f4c6dcf796fa","observation_id":"c428f878-7a90-4f20-b4e0-3ebcb61cef6c","resolution":{"observed_at":"2026-08-12T12:41:12.895912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.881046Z","title":"Embodied question answering","venue":null,"work_id":"f065acb7-8614-48b5-a3f3-3efd104da94c","year":2018},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.915604Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:02c0cc50c65a797a9ae81ebfff1507ec903a0110829dc77e5d9b5b122a5a7a7b","observation_id":"869cafd9-f504-4133-968f-6511437b6efc","resolution":{"observed_at":"2026-08-12T12:41:12.885249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-13T00:52:19.292622Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-12T12:41:11.918948Z","title":"Scene-llm: Extending language model for 3d visual un- derstanding and reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.918948Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:c18ab814b6b05b49163a5be5fd03acc2a0edb2a2e30976c3c14e25f51806c398","observation_id":"1885f780-6d26-43a1-98d4-9af56a37c413","resolution":{"observed_at":"2026-08-12T12:41:11.918948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.869803Z","title":"Cows on pasture: Base- lines and benchmarks for language-driven zero-shot object navigation","venue":null,"work_id":"6abce181-50af-47e7-bf40-c6d759ba17fd","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.922474Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:ac8df821e1f3414b108d654d9cd4fb91b35f661c1ceb44291f8b3e49d018a862","observation_id":"dec94811-4fb1-4952-ae31-51e3319b9022","resolution":{"observed_at":"2026-08-12T12:41:12.873615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.858827Z","title":"Cross-modal map learning for vision and language navigation","venue":null,"work_id":"ea0f0155-427b-49aa-880c-ba5f8725a12a","year":2022},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.925637Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:082cfe4ab543a3faa38908b532843534b431941edcef5f45f8a1fcec2c07b245","observation_id":"76e0c43a-b69d-4c27-833f-ab0f65af864f","resolution":{"observed_at":"2026-08-12T12:41:12.862860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:11.928995Z","title":"Navigating to objects in the real world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.928995Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:c31fbdf77df3696ff58892ee6bbc01db0009ccfa0c1d911503dacb5321baa8e4","observation_id":"32b708a5-5cbd-40d2-b21f-123e5ac94c43","resolution":{"observed_at":"2026-08-12T12:41:11.928995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:11.932150Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.932150Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:c328ac7c479b6de977db6dffd9e4b74e63b66ed23ed5f477fdfec231d5c739e4","observation_id":"8ca44bc9-4fdb-402d-88a8-ff3e0ce14c12","resolution":{"observed_at":"2026-08-12T12:41:11.932150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.833068Z","title":"Vln bert: A recurrent vision-and- language bert for navigation","venue":null,"work_id":"7a2d3ee0-8d03-48a2-9fec-04a58d9c3353","year":2021},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.935910Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:8d379d96e43fd11040cd391d7d398fc2bb96a3e2cbe8ca48ee6f907417e9f24a","observation_id":"73872888-fe33-4669-bc14-3c9fecb41c28","resolution":{"observed_at":"2026-08-12T12:41:12.837099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.821292Z","title":"Bridg- ing the gap between learning in discrete and continuous envi- ronments for vision-and-language navigation","venue":null,"work_id":"ac9afc32-c2dd-4727-b322-d68eccd91d85","year":2022},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.939141Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:d20dbfc9e3de4d0480961a832156a302a2fde9f263188d751b6de1abbddbe77f","observation_id":"d89b78d0-aa78-4caa-b59e-d6dbafd2157e","resolution":{"observed_at":"2026-08-12T12:41:12.825192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.809113Z","title":"Learning naviga- tional visual representations with semantic map supervision","venue":null,"work_id":"b7ee3c0c-b6f5-4e25-852b-d956507d442a","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.942155Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:922a2756a33784469fc2063ecd343ea5958ab859d68651f466d2a1e781d283d3","observation_id":"e9182e90-2f7b-42b1-8c19-7c45b0e82725","resolution":{"observed_at":"2026-08-12T12:41:12.813560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.797454Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":"bb03e546-c3d9-4ffc-ad0b-e5b0ea6809a8","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.945471Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:7d6c435118457522a40f95f67a5253945e5f3fb7e6fcb34fca8ba7d745647576","observation_id":"13d47039-932d-4663-a2f5-c1e7792a0eed","resolution":{"observed_at":"2026-08-12T12:41:12.802173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.786430Z","title":"Sceneverse: Scaling 3d vision-language learning for grounded scene un- derstanding","venue":null,"work_id":"dd31e91b-ca62-4bd6-9f75-ebb180dc89e6","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.948651Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:09c789120812564d1f8be1f50bb03a5319a32bf0eefdc547e27905777046fdaf","observation_id":"4e10c0c2-b6b6-4435-a834-97ae2aa92747","resolution":{"observed_at":"2026-08-12T12:41:12.790379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.775544Z","title":"Lerf: Language embedded radiance fields","venue":null,"work_id":"c4963d8c-fe16-4f13-a595-bb3eaae68586","year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.951760Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:9379dd09341d8a8f8a9d07156fe0953b78a0213ac188539072cbea8bed7bf908","observation_id":"363fd063-7f4b-491e-979a-f2b99222bfa5","resolution":{"observed_at":"2026-08-12T12:41:12.779274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:11.955360Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.955360Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:9e61ff488fecb05018a3bb6ec8a3884d8c1642306264335db6db42c43a9d31ec","observation_id":"734d25ef-28dc-4fd6-95c4-bb9503c799b8","resolution":{"observed_at":"2026-08-12T12:41:11.955360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.758076Z","title":"Sim-2-sim transfer for vision- and-language navigation in continuous environments","venue":null,"work_id":"4c979cf4-c23c-45ff-9dd2-bc4eefba1203","year":2022},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.958517Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:9eec2d60f619fb40c5e034a485097e220f5a9651864e6595124e310708d5620c","observation_id":"ee853e66-ad70-4388-9196-920578050de5","resolution":{"observed_at":"2026-08-12T12:41:12.762076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:11.961691Z","title":"Beyond the nav-graph: Vision-and-language navigation in continuous environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.961691Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:a353b2cd8f202879aa8ff27c6d037ca81c015bb0380aa921599b645d807488f7","observation_id":"506da9f3-d1b5-4441-8e94-95f7f2d6f240","resolution":{"observed_at":"2026-08-12T12:41:11.961691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.730122Z","title":"Renderable neural radiance map for visual navigation","venue":null,"work_id":"353a8edb-bd2a-4699-b99a-3d62f2542e35","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.968341Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:24b1cfaf20f45c5a2c2ffbd6c7bab000b160c63e15271bf88d986dcd2235c596","observation_id":"b078446b-ad7f-45a0-a848-99aa3d927147","resolution":{"observed_at":"2026-08-12T12:41:12.733876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.719640Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling","venue":null,"work_id":"ddd90587-f5b5-4209-883e-5c811301bcdd","year":2021},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.971725Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:8d405a021192bbf3493ab91307bb44f3403cce48ae4e745459a29088b88c6b36","observation_id":"5c93262a-6c93-4592-a97b-2e991490be2e","resolution":{"observed_at":"2026-08-12T12:41:12.723406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:11.974912Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.974912Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:fcffd453d495740d2b73c39240b57031ebd8d200940487fbe94612a094433a2d","observation_id":"9814a060-b2f8-4963-b14c-b1e8c3005b1a","resolution":{"observed_at":"2026-08-12T12:41:11.974912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.702927Z","title":"Grounded language-image pre-training","venue":null,"work_id":"731729dc-4308-429c-a337-d464bf216834","year":2022},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.978223Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:b498d9e0e50ba24ed6dcf7b8ecd83f36e7f301208c332994cd3167c9cd250ce2","observation_id":"80dec119-ca83-433d-ae63-8da5493d4f70","resolution":{"observed_at":"2026-08-12T12:41:12.706517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.691525Z","title":"Bird’s- eye-view scene graph for vision-language navigation","venue":null,"work_id":"9f23ac28-1286-471e-9005-66ddda6be607","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.981613Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:e85c9ad18492b2ed000536baa5c1d82244a38229cdb415cbc6987755ebd2783d","observation_id":"96f7fa9f-6812-4373-9edf-e19d74043d10","resolution":{"observed_at":"2026-08-12T12:41:12.695814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.679914Z","title":"Vision-language navigation with energy-based policy","venue":null,"work_id":"76a6d88e-780b-4cb8-8aac-569b1b4c363c","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.985225Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:2a514709ece5047a2febbe8dc6839e767032bc9c7f940052ad3141f2b8af2961","observation_id":"a6a11262-f324-4279-940d-6c9f6ac64e3d","resolution":{"observed_at":"2026-08-12T12:41:12.683914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.668350Z","title":"V olumetric envi- ronment representation for vision-language navigation","venue":null,"work_id":"b52f37f2-90ad-42fd-bbc1-1fa9b38fb3e4","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.988628Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:b5aeefb5ab00f25469f8eca1a89baf86cf2813f55edd1aeaa81fc44c237a0a34","observation_id":"2f963d95-0fbe-4569-9e28-cd0474b56ffb","resolution":{"observed_at":"2026-08-12T12:41:12.672126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-12T12:41:11.992187Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.992187Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:e55d94e79c56b46c1e50fc7f4f1ebb4577441df1ce7f389b764da6e43461e827","observation_id":"d922b81b-96af-4e65-9622-4ba1d5d98a3b","resolution":{"observed_at":"2026-08-12T12:41:11.992187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.657039Z","title":"Instructnav: Zero-shot system for generic instruction navigation in unexplored environment","venue":null,"work_id":"1051b732-30cc-4e23-bfb1-e20114db0f4e","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.995710Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:7221ac14a904ca14aaff073bc6267e120f1cbefa3f28b822856db4fde1ea2524","observation_id":"6eaef7e8-4f0b-4f82-a952-fa7b0c0f42d4","resolution":{"observed_at":"2026-08-12T12:41:12.661182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.645222Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":"ff2042de-51de-4a71-9257-c21dccfb8100","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.998993Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:c844f3bbfd714633852342ab4d21c89d8fcbe5dcd29f06b340da63a619a337de","observation_id":"3af6b1bc-3dd0-4d51-85e6-a82ddbdd8796","resolution":{"observed_at":"2026-08-12T12:41:12.649709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.634943Z","title":"Rec- tifier nonlinearities improve neural network acoustic models","venue":null,"work_id":"ca612068-7fba-4a3f-9276-80d203c44d00","year":2013},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.002258Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:5f91b3a293002e6f3b69b7a2e265da61a793c2cfe091d5ef9c03c8a8fd9ef38b","observation_id":"acabc30d-ae47-41bc-822a-2efb0c3c2ae6","resolution":{"observed_at":"2026-08-12T12:41:12.638752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.005584Z","title":"Zson: Zero-shot object-goal navigation using multimodal goal embeddings","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.005584Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:84755b6ae6f022443e5ae76c6059f9c1b563ddc2bc35dbb59155d37be1c6d8fd","observation_id":"b219f52c-18d2-4a73-9c1c-d1b6b7334312","resolution":{"observed_at":"2026-08-12T12:41:12.005584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.618508Z","title":"Openeqa: Embodied question answering in the era of foundation models","venue":null,"work_id":"429306be-4b89-4ab4-8041-5daa12185daf","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.009453Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:c06eee7f6ea34355e7e33116706d014f7278ab6e55177322c67c4727626483db","observation_id":"8f1cc444-c362-4453-8cf2-638a197fb633","resolution":{"observed_at":"2026-08-12T12:41:12.622137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.012861Z","title":"Nerf: Representing scenes as neural radiance fields for view syn- thesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.012861Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:1ccbfb3b79d2bac3d2501b3fd6f49fc5ac83044ada4dad6951977c5d91e387bb","observation_id":"43b429da-8ac1-439c-a8d4-b5ecc2147b59","resolution":{"observed_at":"2026-08-12T12:41:12.012861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.601213Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":"83bffde8-b76f-4cee-8e97-96c0abf30bef","year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.016089Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:1829b8d89a10756a4b67e73fc393f308d7280847bb6d47e4c00861e8eb816f10","observation_id":"799e14c3-c2b6-45c3-97a3-c889cc582bef","resolution":{"observed_at":"2026-08-12T12:41:12.605027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.590570Z","title":"Hop+: History-enhanced and order-aware pre-training for vision-and-language navigation","venue":null,"work_id":"4a106da0-44a1-44bc-bbff-a49f5f446859","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.019609Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:fb2262b54039ee778fa980bca72be8bd603828758b09f4c662f2d08316bd86f2","observation_id":"0660d706-73e8-4c6c-8ad2-570514e5ff43","resolution":{"observed_at":"2026-08-12T12:41:12.594285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07563","last_updated":"2024-11-26T10:31:15Z","snapshot_observed_at":"2026-08-13T00:56:47.710270Z","submitted_at":"2024-03-12T11:51:55Z","title":"Learning Generalizable Feature Fields for Mobile Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07563","snapshot_observed_at":"2026-08-12T12:41:12.022955Z","title":"Learning generalizable feature fields for mobile manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.022955Z"},"links":{"cited_paper":"/paper/2403.07563","citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:36ac31d4c720711dcc06e1e3bbba1a122b242744c33a893b3ac5238fd3d9ac73","observation_id":"4bc9e5cb-477f-485f-8bdb-6e86c9f83573","resolution":{"observed_at":"2026-08-12T12:41:12.022955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.026703Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.026703Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:0b2d22bbed40a6f8a364dab747c638a6dcaa7e4e349e05abbc8c95471b5ccd6f","observation_id":"9029cb07-d3b0-41e2-9958-a4a5f6b4e352","resolution":{"observed_at":"2026-08-12T12:41:12.026703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.573847Z","title":"Habitat-matterport 3d dataset (hm3d): 1000 large-scale 3d environments for embodied ai","venue":null,"work_id":"6d4fa200-535a-4c17-99ef-92b8c8e24b8c","year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.029853Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:f1575d355c22f6c7c9b61a72d66acc45de54231e490c336a190cb153e0295349","observation_id":"f94223b8-6c9a-4f83-b735-5189b4c35249","resolution":{"observed_at":"2026-08-12T12:41:12.577550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.563931Z","title":"Poni: Potential functions for objectgoal navigation with interaction- free learning","venue":null,"work_id":"b21b5165-312e-4038-a372-5a1d0effef54","year":2022},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.033132Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:7511e6559cbfa7a052093496a0db26c8125ebddcd50976308b69907c7d816098","observation_id":"9f13ec18-5be7-4d83-8e1e-5953cc51592b","resolution":{"observed_at":"2026-08-12T12:41:12.567723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.553810Z","title":"Habitat: A platform for embodied ai research","venue":null,"work_id":"4436093c-633e-400e-bee6-bd26775bd796","year":2019},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.036557Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:e743134cc6ff545cb901be8244794e8d3ce702cd5e5c912613ad2761252c6f04","observation_id":"275dd167-0b4f-4ff0-a88c-3f515edf0292","resolution":{"observed_at":"2026-08-12T12:41:12.557450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.543526Z","title":"Distilled feature fields enable few-shot language-guided manipulation","venue":null,"work_id":"6e57a2ae-c1ae-4699-8a54-786854738926","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.040645Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:26ef51e141579420693e74f16949c444c6c7a983aa7ce32a4c4c9a6e8f7ed9fb","observation_id":"30efd223-28ce-48db-be1a-e388086bcf4a","resolution":{"observed_at":"2026-08-12T12:41:12.547216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.532960Z","title":"Language- enhanced rnr-map: Querying renderable neural radiance field maps with natural language","venue":null,"work_id":"0f92b6da-1179-4cfc-82f7-8b1ee408ab1e","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.043939Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:20f5e75aec8ce125722666f7391a8388e094cb14c3c8d070e5f90472fec48a2e","observation_id":"3a295e05-5e5f-4f1e-ae33-616a181d9ab5","resolution":{"observed_at":"2026-08-12T12:41:12.536766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.522422Z","title":"Nesf: Neural semantic fields for generalizable semantic segmentation of 3d scenes","venue":null,"work_id":"daa71983-3171-42e5-ac96-da6f38de0ac0","year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.047825Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:f7bf2696f30116e55a306280e16356e9db86964052e05a38589ff4e5be7cf916","observation_id":"38570152-e3ba-45fe-b1f1-3103b9430c44","resolution":{"observed_at":"2026-08-12T12:41:12.526238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.510848Z","title":"Yolov7: Trainable bag-of-freebies sets new state-of- the-art for real-time object detectors","venue":null,"work_id":"e80582f0-66b5-4c20-a6ba-a5386b593974","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.051271Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:efd598da016543482f299b17e6e0a48efa08104fc96fe866193715f48e1f7a90","observation_id":"0c292a5f-4771-4abf-b773-dc6b58d0ac3e","resolution":{"observed_at":"2026-08-12T12:41:12.514554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.500862Z","title":"Dreamwalker: Mental planning for continuous vision- language navigation","venue":null,"work_id":"b47f33a0-f857-4053-a71f-00df7506366f","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.054825Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:d7a7e6dea60229d58ee879dd7688b851d3a9432fe3097c777670ee7301ac906e","observation_id":"e754e9da-692d-4d63-8c4f-1fd9d0d90841","resolution":{"observed_at":"2026-08-12T12:41:12.504479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.489465Z","title":"Vision-and-language naviga- tion via causal learning","venue":null,"work_id":"ce099e04-eefd-44ef-9951-e90afdf90fdf","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.057945Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:b832a574740293a2f7f9c823a3e26232215589198ed0b8208b783cb163a6fef9","observation_id":"7ef24cfe-8734-4619-8497-4c8357801ad9","resolution":{"observed_at":"2026-08-12T12:41:12.493108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.374556Z","title":"Scaling data generation in vision-and-language navigation","venue":null,"work_id":"f4373ee1-7632-432b-b0c9-27301fcec715","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.061317Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:70dc571f4973a09a4f25bc99dceb3b612c1a4b3cb91fc60f60e722a44d54e632","observation_id":"c9637c06-818f-4736-9e5b-f8a8ebf87488","resolution":{"observed_at":"2026-08-12T12:41:12.378148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.364198Z","title":"Gridmm: Grid memory map for vision- and-language navigation","venue":null,"work_id":"5baf8a48-7c53-4c00-9d10-9c21236e01ad","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.064542Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:8dd7cbd385568c88104479f021296f2fdbe195455ca109f86bb91fd12e8c9dc1","observation_id":"797ef658-db03-4662-8867-767ab07b4058","resolution":{"observed_at":"2026-08-12T12:41:12.367838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.353989Z","title":"Lookahead exploration with neural radiance representation for continuous vision-language navigation","venue":null,"work_id":"daf130c2-7f3a-436d-9ed5-b6b322df5777","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.067942Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:159fd273951655c2ab40663f64c56512402b1fba19c835d0e76162dcc1761966","observation_id":"7f27c71e-ab7d-4931-92b5-81434c9ad481","resolution":{"observed_at":"2026-08-12T12:41:12.357768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.343256Z","title":"Sim-to-real transfer via 3d feature fields for vision-and-language navigation","venue":null,"work_id":"e99277e3-d43d-4cf1-ab2d-483b07073c2e","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.071256Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:ccfd6ef22e5df687389fa01788c05f3408609e31f133440aed390b63bae78a64","observation_id":"6c45ba32-515f-4d69-a2b9-2e2b267c89e8","resolution":{"observed_at":"2026-08-12T12:41:12.346864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00357","last_updated":"2020-01-20T04:18:58Z","snapshot_observed_at":"2026-08-10T18:52:30.296569Z","submitted_at":"2019-11-01T13:07:37Z","title":"DD-PPO: Learning Near-Perfect PointGoal Navigators from 2.5 Billion Frames","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00357","snapshot_observed_at":"2026-08-12T12:41:12.074625Z","title":"Dd-ppo: Learning near-perfect pointgoal navigators from 2.5 billion frames","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.074625Z"},"links":{"cited_paper":"/paper/1911.00357","citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:c7ebadbe3a3f0173f7f7ee18a6077761c4e4ee3408aa870a7c850f8021084d1f","observation_id":"0ed69188-07b2-48da-aa16-dd27c97f58b6","resolution":{"observed_at":"2026-08-12T12:41:12.074625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.333460Z","title":"Habitat-matterport 3d semantics dataset","venue":null,"work_id":"fc1af739-c183-438f-b8f6-8e585c29690f","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.078457Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:33257c518b01d88a7636ed6bda5f5cbdb09ff243a7663e0c39acc5753312de19","observation_id":"f260ae16-0bf0-4afc-bba2-23a88b0ccaed","resolution":{"observed_at":"2026-08-12T12:41:12.336927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.323282Z","title":"Sg-nav: Online 3d scene graph prompting for llm-based zero- shot object navigation","venue":null,"work_id":"6df83c24-f0bf-4326-9bfb-d7402f64d005","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.081615Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:c86256f98845513e921c02761414cdd7fa2852f2d3f9e7e626be86407905e551","observation_id":"fa71a361-cad1-48f5-91c6-85029c07c25b","resolution":{"observed_at":"2026-08-12T12:41:12.327125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.313151Z","title":"Vlfm: Vision-language frontier maps for zero-shot semantic navigation","venue":null,"work_id":"0716480f-7ac3-425a-8b03-db7aa2085dc1","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.084976Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:bdf4dac2d0b8edfe493614f84e8d489c30fcc6419b0ec12dd60f2b1b7998d3b7","observation_id":"b40685bc-3f62-49ed-a08a-561e8dd76c41","resolution":{"observed_at":"2026-08-12T12:41:12.316777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.302135Z","title":"Gamap: Zero-shot object goal navigation with multi-scale geometric-affordance guidance","venue":null,"work_id":"b305c061-e9e9-4d36-9c98-ce1ff5c80dbc","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.088244Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:e29a1c8fdeb8f3ea6f97db22ec816577f72a7ac3f2f9e0e36cfa4359f2b6deb1","observation_id":"a1bd8e4a-31d3-4df6-9ba7-00ac66e88785","resolution":{"observed_at":"2026-08-12T12:41:12.306045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.291158Z","title":"Gnfactor: Multi-task real robot learning with generalizable neural feature fields","venue":null,"work_id":"9ad9a09a-ffd5-42a2-970b-1fcf07c633c4","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.091402Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:49ffde4d684062fdf8298fc9ad2e99e384f335f1741fa9c51b79a16cd177b40e","observation_id":"7462ac0a-36cd-40e2-8cc9-e867d1b13a85","resolution":{"observed_at":"2026-08-12T12:41:12.295173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14289","last_updated":"2023-07-01T07:26:22Z","snapshot_observed_at":"2026-08-12T07:11:05.316372Z","submitted_at":"2023-06-25T16:37:25Z","title":"Faster Segment Anything: Towards Lightweight SAM for Mobile Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14289","snapshot_observed_at":"2026-08-12T12:41:12.094566Z","title":"Faster segment anything: Towards lightweight sam for mobile appli- cations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.094566Z"},"links":{"cited_paper":"/paper/2306.14289","citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:b7a585671e8e052b3b4643a8068f0600513eb9de9955c7fac84151fe45f64bbd","observation_id":"2c148112-3bef-49ce-bd06-f546961a116e","resolution":{"observed_at":"2026-08-12T12:41:12.094566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03540","last_updated":"2024-11-05T22:42:41Z","snapshot_observed_at":"2026-08-12T22:06:53.761496Z","submitted_at":"2024-11-05T22:42:41Z","title":"VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03540","snapshot_observed_at":"2026-08-12T12:41:12.098137Z","title":"Vla-3d: A dataset for 3d semantic scene understanding and navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.098137Z"},"links":{"cited_paper":"/paper/2411.03540","citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:98683486b0e2fd8b7c23e25decb0c81e1f1ec1e4d7847be58ad3039efab29e93","observation_id":"4120d482-e917-4997-adff-0b203aa3310c","resolution":{"observed_at":"2026-08-12T12:41:12.098137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.280393Z","title":"Navid: Video-based vlm plans the next step for vision-and-language navigation","venue":null,"work_id":"8359b558-48b4-4d30-93ee-53965f092023","year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.102131Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:3edaf693f98d2ac38da4243dc71a6f3ce633d9db20c06865d52c6be7f083b4fc","observation_id":"8aeaf061-8751-411e-a01c-9160b7a018b3","resolution":{"observed_at":"2026-08-12T12:41:12.284146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.269318Z","title":"Hierarchical object-to-zone graph for object navigation","venue":null,"work_id":"9b807070-88df-4fd6-a4d6-553d3e40baa6","year":null},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.105441Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:671d201d9765c91d11f38510c93a8a741339f78f2d9bf63c77ec7e1785234a5d","observation_id":"fa271cb0-fd70-420d-a31c-f992cd34dab4","resolution":{"observed_at":"2026-08-12T12:41:12.273067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07035","last_updated":"2024-12-29T23:16:37Z","snapshot_observed_at":"2026-08-12T23:25:39.126520Z","submitted_at":"2024-07-09T16:53:36Z","title":"Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07035","snapshot_observed_at":"2026-08-12T12:41:12.108676Z","title":"Vision-and-language navigation today and tomorrow: A survey in the era of foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.108676Z"},"links":{"cited_paper":"/paper/2407.07035","citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:371b5e30d59f133075fa42663da796b3ecf40bf74ab47ba097c2048fbbc651f7","observation_id":"3f685f3c-5c53-4d7f-821c-010b9b0811ea","resolution":{"observed_at":"2026-08-12T12:41:12.108676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.258009Z","title":"Structured3d: A large photo-realistic dataset for structured 3d modeling","venue":null,"work_id":"46abc287-4427-4a0c-abde-c7ca21b7a64e","year":2020},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.112252Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:63e5fa9d10ac03e2d8a108e8ea2ada3fcd3e9f72254a12073d838d12e6a14a82","observation_id":"972c91b2-2fd4-46f2-9052-4f568cad6185","resolution":{"observed_at":"2026-08-12T12:41:12.261828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.247197Z","title":"Esc: Ex- ploration with soft commonsense constraints for zero-shot object navigation","venue":null,"work_id":"46a584db-22a0-4319-b2e8-94e167cdc1b7","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.115389Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:9b1d7bceb5c1129b9e77bf1191336f88c0bea1d8dad5b59abe8f4af0446b3596","observation_id":"5b35027b-bcc9-4f56-8f6d-7fd025de0259","resolution":{"observed_at":"2026-08-12T12:41:12.251040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.236056Z","title":"Target-driven visual navigation in indoor scenes using deep reinforcement learning","venue":null,"work_id":"95ce3fe7-59e6-46bf-ab97-c53d5dfaf7bb","year":2017},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.118655Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:a6d3850f538ab67f988c96162688cfc249e77c3ee8a39415dbcc111cb49e362c","observation_id":"010eede6-6f5d-4f05-bb16-3215ce0de232","resolution":{"observed_at":"2026-08-12T12:41:12.240154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.223195Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":"87ae2c7a-a247-43bc-b144-b8e4f9f29e65","year":2023},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.121854Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:ea0168135a892824414f0899f17e5b13e5d7be73e64a9ef86037b6c0cb5a493b","observation_id":"b7cf2336-14b3-4f69-b85b-ac37afa3c1de","resolution":{"observed_at":"2026-08-12T12:41:12.228653Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:41:12.741290Z","title":null,"venue":null,"work_id":"a4774b36-793b-47ec-b9ae-7e1fd0e4e4a9","year":2020},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:11.965153Z"},"links":{"citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:3ec1b9baeda1d5b0024388665ed6581e8f8be3056646ba0dbe1a78891a1eea61","observation_id":"dbfdaba3-38a0-45a0-bee0-57375ecc9b91","resolution":{"observed_at":"2026-08-12T12:41:12.744699Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T12:33:40.517766Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":17,"verified_exact":0,"verified_fuzzy":55},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 0 inbound Pith citation observations for arXiv:2411.17030."}