Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-15T20:59:11.164370Z
Paper Citation Record · LEDGER
As of 16 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 6 inbound Pith citation observations for arXiv:2505.11383.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-15T20:59:11.164370Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-16T06:30:59.297886+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-01T12:04:39.821353Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-07-02T14:37:03.075467Z
60 of 60 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation 01d8955a-8656-45e7-b7e4-24c4531b860d · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d038db71-6345-4fb3-ad16-aeb9a5715e14 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Reverie: Remote embodied visual referring expression in real indoor environments
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d9e9caf6-4b13-4bed-8dd9-b3e6c09b2f2c · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Beyond the nav- graph: Vision-and-language navigation in continuous environments
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 45278d17-f96a-4c42-baeb-20620e5e5c34 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation NavRAG: Generating User Demand Instructions for Embodied Navigation through Retrieval-Augmented LLM
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 705f5863-bebe-4c38-8383-8273c10a40e6 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Navid: Video-based vlm plans the next step for vision-and-language navigation
Reference 5
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation bcaf25e4-d524-4bf8-a3f5-77a3e0cbd0ec · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d61b36e6-545f-431c-a197-7e3e499c7063 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Navila: Legged robot vision-language-action model for navigation
Reference 7
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation b3b93662-d1aa-4d52-8dc3-4e5398686caa · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Video-LLaVA: Learning United Visual Representation by Alignment Before Projection
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0f5cd850-a1ea-407f-85f6-db18870e19c9 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Vila: On pre-training for visual language models
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 996261e8-7526-41ee-a2bd-20522179c51d · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation da6b1330-cdc2-43e2-8445-7722539e026e · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Learning transferable visual models from natural language supervision
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9e8723f9-ff7d-4355-be5c-e9272afdcde4 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Fast Segment Anything
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3efa4660-06ae-47dd-9c5c-2562faa81aa3 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Embodied- sam: Online segment any 3d thing in real time
Reference 13
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation b51ff56e-42fa-4640-a62e-899912c30b18 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks
Reference 14
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation 8a0a6a91-d385-4944-8dd5-5be7d7a306d6 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Vln bert: A recurrent vision-and-language bert for navigation
Reference 15
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation d746555c-a006-4a4d-9404-4d5878ab8a2f · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation History aware multimodal transformer for vision-and-language navigation
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 131334fe-8c88-4760-9047-80e969dac600 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Think global, act local: Dual-scale graph transformer for vision-and-language navigation
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3bdf7c7a-c675-42f4-b41c-a9caadf81c4c · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Vision- and-language navigation via causal learning
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation eb7cb573-bf4a-4532-9ac4-ba7134ed269c · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Hop+: History- enhanced and order-aware pre-training for vision-and-language navigation
Reference 19
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation 2620a608-4819-4edf-b17a-1b0256c8985e · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Bird’s-eye-view scene graph for vision- language navigation
Reference 20
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation fe999097-561a-4e17-811a-ea95375f2453 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Matterport3d: Learning from rgb-d data in indoor environments
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ba6d9897-ac8a-498f-827d-5d122622a9d3 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Habitat: A platform for embodied ai research
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3826abaa-d65d-423e-90ed-837387ce4795 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Bridging the gap between learning in discrete and continuous environments for vision-and-language navigation
Reference 23
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation 0dd1d137-ae3a-48d7-a8fd-b90898c06c12 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Gridmm: Grid memory map for vision-and-language navigation
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 32cf35d3-5940-4fe4-8d7c-d0e5f10a224b · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Etpnav: Evolving topological planning for vision-language navigation in continuous environments
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9026c242-c737-4e68-bdb4-8cb23b074a4f · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Bevbert: Multimodal map pre-training for language-guided navigation
Reference 26
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation 6d3d0a0b-aaeb-4744-9d4f-1dbf17bd71f3 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Sim-to-real transfer via 3d feature fields for vision-and-language navigation
Reference 27
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation 3b312087-5dd7-42f7-ae1f-96e991bd4927 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Open-nav: Exploring zero-shot vision-and-language navigation in continuous environment with open-source llms
Reference 28
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation 0cfb4c6b-3c7b-40f8-8066-1e7ab584f861 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bf22fda2-2145-4d70-ab77-38def4453fd7 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Unresolved cited work
Reference 30
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation 9f6a8151-3867-41fe-81e5-0f6fdbd0d5d9 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Unresolved cited work
Reference 31
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation 725ba98b-b1d8-4018-aa3a-29813f2fba55 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023
Reference 32
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 42c64cff-a0f4-41e9-a8e7-87ab19b0a4f7 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Improved baselines with visual instruction tuning
Reference 33
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a916a59d-7d46-48e3-aac3-24f8236b1d8c · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning
Reference 34
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b171e546-d8cd-4076-8a8f-7972e223fc3f · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
Reference 35
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8eecf82a-69cd-4065-92be-1720cb442572 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation An embodied generalist agent in 3d world
Reference 36
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation 64c95c6e-091b-4714-81cf-6abfc2239f41 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning
Reference 37
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c782b4a2-c2ee-4cfe-b079-3788ba651885 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation 3d-llm: Injecting the 3d world into large language models
Reference 38
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 950c6378-f069-49eb-9012-56ffe44cb7b6 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding
Reference 39
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 346d152d-5f34-45c0-a6a0-ab946f40cebc · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness
Reference 40
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 14734b56-16dd-4f6c-a957-0ba37e13f1e0 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Lookahead exploration with neural radiance representation for continuous vision-language navigation
Reference 41
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation 474084a7-5bbd-4641-92f0-e2fe4e7770e0 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Learning Generalizable Feature Fields for Mobile Manipulation
Reference 42
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ecc44f67-62e1-4f06-9120-7508788c4a01 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Scannet: Richly-annotated 3d reconstructions of indoor scenes
Reference 43
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 35e81402-52cf-4eca-a141-d8ad255f3ee7 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Habitat- matterport 3d semantics dataset
Reference 44
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1c8ec00f-2ea0-492b-9143-af31ef56b098 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Rio: 3d object instance re-localization in changing indoor environments
Reference 45
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation c4f3ca20-cb4a-47ad-843d-610c1d23d289 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Sceneverse: Scaling 3d vision-language learning for grounded scene understanding
Reference 46
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation 5d428d5f-01d3-4f7f-b810-584d1861ed4b · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Feature Splatting: Language-Driven Physics-Based Scene Synthesis and Editing
Reference 47
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 80f4a096-6e24-4429-aae3-3da3c5fb0227 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Xtuner: A toolkit for efficiently fine-tuning llm
Reference 48
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c1f25e16-a2e5-4f69-a7bd-1be5f863865c · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone
Reference 49
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ee9c700a-27dd-4ec4-bc40-bd90809ce39b · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Cross-modal map learning for vision and language navigation
Reference 50
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation 0745b914-d419-47a4-8055-e89f749e0b04 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Weakly-supervised multi-granularity map learning for vision-and-language navigation
Reference 51
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation 480992bc-787d-44d2-90d6-9fe4a143bf06 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Instructnav: Zero-shot system for generic instruction navigation in unexplored environment
Reference 52
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation eeb33017-9d81-4ecc-ac59-29b2f28d52c1 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Affordances-oriented planning using foundation models for continuous vision-language nav- igation
Reference 53
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation 8a683655-5628-45f2-840f-6cbd29249200 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Arkitscenes: A diverse real-world dataset for 3d indoor scene understanding using mobile rgb-d data
Reference 54
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0e832c77-1435-4575-82fc-4d87149dd052 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Structured3d: A large photo-realistic dataset for structured 3d modeling
Reference 55
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation d0d8957f-b1f3-40df-8ac2-c8058f3bad83 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Scaling data generation in vision-and-language navigation
Reference 56
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation 5bd952d9-d33d-4e06-a66b-e976435b16bf · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation A reduction of imitation learning and structured prediction to no-regret online learning
Reference 57
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1ecbbded-bccb-4ae6-a056-5c7da6d6e675 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Adafactor: Adaptive learning rates with sublinear memory cost
Reference 58
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1f72137b-27b2-4585-9596-37037a535bad · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Training Deep Nets with Sublinear Memory Cost
Reference 59
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3d4c7a5b-a3b9-4828-a977-cf88c588ed25 · outbound
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Dynamem: Online dynamic spatio-semantic memory for open world mobile manipulation
Reference 60
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation 10920aae-b0b6-40f6-bfb5-c4bd0db6c11c · inbound
Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation
Reference 33
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation a7609af3-49f1-4cfe-b0ae-76e5d5b2bd0e · inbound
What Limits Vision-and-Language Navigation ? Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation
Reference 37
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation 0e70a95a-c0ab-45f8-ba18-94a5f067105f · inbound
GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation
Reference 37
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation 60fad76a-54e2-40b7-abc8-9a427e75a6d3 · inbound
Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation
Reference 33
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation a7332381-e0b8-49e3-94e3-26f339981b26 · inbound
NoPA: Non-Parametric Online 3D Scene Graph Generation Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation
Reference 31
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.
Observation 6068e15d-7e0d-4aa9-ae6b-46132f95e96f · inbound
NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.