{"as_of":"2026-08-03T21:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a983924c933f34e5cd0c0e0f724a3a849e51155289cff5940e093c6d8817f054","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T20:42:04.352249Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23504/citation-record","integrity":"/paper/2607.23504/integrity","json":"/paper/2607.23504/citation-record.json","paper":"/paper/2607.23504"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-30T20:42:02.541961Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:02.541961Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:fe0bead8bbbabe0639af6b439bc627c103913f131193c1f68f4f11e6420c2be0","observation_id":"4249682e-8f12-4b2b-ae4f-320f69361e1c","resolution":{"observed_at":"2026-07-30T20:42:02.541961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:02.628557Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35: 23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:02.628557Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:d9b6b6091b690544aed9143f42da5cbfd55f56e0021bbb007c912f88e5ddafd7","observation_id":"e67b5f55-f346-4833-8788-7def70da434e","resolution":{"observed_at":"2026-07-30T20:42:02.628557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:02.675416Z","title":"Etpnav: Evolving topological planning for vision-language navigation in continuous environments.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:02.675416Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:0e57009a059601e04c7a6036376a97cc2b49d785b4f66f3a0ec8d0367b4b1795","observation_id":"c85c0990-00a8-4e6d-b5d4-ad78ce59a3fe","resolution":{"observed_at":"2026-07-30T20:42:02.675416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:02.715588Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:02.715588Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:d97b0864db6feae3b525a58f7ebfeac5f1dff16e9c0455d3cff284d3ce4a1af0","observation_id":"166c0485-c004-449f-81b5-7ca6189cc13a","resolution":{"observed_at":"2026-07-30T20:42:02.715588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:02.785592Z","title":"Sim-to-real transfer for vision-and-language navigation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:02.785592Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:dfbb3933eb807006df97333d011785225e915bf5ea116adc58341973ca0be478","observation_id":"c924cc41-2f60-424d-9c01-ac2f39d972f8","resolution":{"observed_at":"2026-07-30T20:42:02.785592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-30T20:42:02.854773Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:02.854773Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:56af6e15c0a1ca00b7c902c3146187c7e54679db3df7809582e4767f4815305a","observation_id":"17d349f9-9cfd-4e5f-a6e6-14f848601dc3","resolution":{"observed_at":"2026-07-30T20:42:02.854773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:02.903996Z","title":"Topological planning with transformers for vision-and-language navigation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:02.903996Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:98be29bee5ada2c64691fee6e6c5ed409d2b7f746fe13c57693ff2026e9a7e1a","observation_id":"338138f6-32f2-45ea-a9a7-c25effd74dff","resolution":{"observed_at":"2026-07-30T20:42:02.903996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:02.981520Z","title":"Weakly-supervised multi-granularity map learning for vision-and-language navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:02.981520Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:b88d7ef7219f3d389e8a0f7407ea9935e3c97950d2f4e54c812b25036864e3f6","observation_id":"16cca270-3de1-432f-8d88-495bcdfd5430","resolution":{"observed_at":"2026-07-30T20:42:02.981520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-30T20:42:03.068111Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.068111Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:9551a3b0b28e873927ee78f7f81a2a360f58d9284b68c1680af11bf0d87c611d","observation_id":"51a0af7a-2ead-4729-b06b-9357ef1cda00","resolution":{"observed_at":"2026-07-30T20:42:03.068111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-07-30T20:42:03.137249Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.137249Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:a2067d03d8052044fa58a32f8b4a0eac8e5cdec3a8a17dc64c64b4bd3cfd6a1b","observation_id":"c86f0159-f8d6-4547-8650-1b13c692fc31","resolution":{"observed_at":"2026-07-30T20:42:03.137249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.197473Z","title":"Speaker- follower models for vision-and-language navigation.Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.197473Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:fb6779c174a9f6080cfe44899afc0e73ba6bea50cdec2efb3f4ff0a2c54afd67","observation_id":"94c847d0-1e6b-40a3-a78f-550293eed3ad","resolution":{"observed_at":"2026-07-30T20:42:03.197473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.241149Z","title":"Counterfactual vision-and-language navigation via adversarial path sampler","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.241149Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:84142e85a430ef1ef8aecd33dd77653b3e2bf2a19f47049623c6f38aab9e0c51","observation_id":"4f368302-63c0-4c80-a8ba-595c46d7c586","resolution":{"observed_at":"2026-07-30T20:42:03.241149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.299565Z","title":"Cross-modal map learning for vision and language navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.299565Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:c027cde41723b2ca07ac962ea3990b72f41a2af053feaabfb49edff5cffec154","observation_id":"e55bdd75-8713-4096-8559-266d6033c395","resolution":{"observed_at":"2026-07-30T20:42:03.299565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.349403Z","title":"Language and visual entity relationship graph for agent navigation.Advances in Neural Information Processing Systems, 33:7685–7696, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.349403Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:c7a77279ecac6c25b9e4d307ddfdcd39153ecb84fa5fe2ac07a24eb06350dcbf","observation_id":"270290de-cb87-4127-9f80-2746f625f5c3","resolution":{"observed_at":"2026-07-30T20:42:03.349403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.414738Z","title":"Bridging the gap between learning in discrete and continuous environments for vision-and-language navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.414738Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:a86dae1885f9c603a03edd75214f5c9270dc6693ecaf24f35d87b8273e53f798","observation_id":"a6b9bfce-89b2-4c02-971b-9be105d8bd8f","resolution":{"observed_at":"2026-07-30T20:42:03.414738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.492588Z","title":"Sim-2-sim transfer for vision-and-language navigation in con- tinuous environments","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.492588Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:355334aaec8df987b7e63444ba13cd9404c5ec3da5d78ff5425c6674e104b11c","observation_id":"f11714af-b5db-4d05-8e1d-824a81b8b085","resolution":{"observed_at":"2026-07-30T20:42:03.492588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.547400Z","title":"Beyond the nav- graph: Vision-and-language navigation in continuous environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.547400Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:f68a48cc3acc2ff9a475c7155f6ca5e84bea85d13f1a7a60ff4d5a3b22168e32","observation_id":"3ebf72e2-17f2-4326-92d3-cde805daa004","resolution":{"observed_at":"2026-07-30T20:42:03.547400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.624402Z","title":"Waypoint models for instruction-guided navigation in continuous environments","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.624402Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:1f8a00fb6efca199c6cec461be6f04bcd45a5634fb493b9b11e547a9d5b466e8","observation_id":"b69145a9-ff25-4ff7-a389-99f55bd69f92","resolution":{"observed_at":"2026-07-30T20:42:03.624402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.706075Z","title":"Room-across- room: Multilingual vision-and-language navigation with dense spatiotemporal grounding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.706075Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:b44ae00b0c0b80bb3df23dbb79f36769b0fc7dc2d67d1e039d433fe439219cdc","observation_id":"830de76f-17a1-4e7d-9bae-0b9a47022a18","resolution":{"observed_at":"2026-07-30T20:42:03.706075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-30T20:42:03.770114Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.770114Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:add501e3e49d09c07fa7da5be1e4641c5ab384d7bf9f537a602b317bfdc1f647","observation_id":"77161361-f183-4dea-b951-ef5468de47e1","resolution":{"observed_at":"2026-07-30T20:42:03.770114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.851911Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.851911Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:62b14a61a4b4583627bfde84275896c7eebabd19ecdbf92ee12d86065548273b","observation_id":"05df4398-8db7-45a9-bdc6-e94aae7c0cc0","resolution":{"observed_at":"2026-07-30T20:42:03.851911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.945113Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.945113Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:bc6bc2c6a210c5ffa92cdbe156d15c7c1b72807a690fd5d31707634d0c1167c4","observation_id":"a1967f81-244f-4340-a806-6019a8046a72","resolution":{"observed_at":"2026-07-30T20:42:03.945113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:03.969709Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.969709Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:7494fb0492471167a94dd21f87e9cc176a4499a032eb30b7c9710eadf0d6f47d","observation_id":"6753bae8-a674-4081-8b2d-524570ad9582","resolution":{"observed_at":"2026-07-30T20:42:03.969709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04882","last_updated":"2024-06-07T12:26:34Z","snapshot_observed_at":"2026-07-06T18:27:07.473039Z","submitted_at":"2024-06-07T12:26:34Z","title":"InstructNav: Zero-shot System for Generic Instruction Navigation in Unexplored Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04882","snapshot_observed_at":"2026-07-30T20:42:04.019111Z","title":"Instructnav: Zero-shot system for generic instruction navigation in unexplored environment.arXiv preprint arXiv:2406.04882, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.019111Z"},"links":{"cited_paper":"/paper/2406.04882","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:655bf0f64891328aec3d60265db229e42cb040f7d53163e103cfbab89f801098","observation_id":"bf81f264-832a-4a0b-9f3e-efb10f36af84","resolution":{"observed_at":"2026-07-30T20:42:04.019111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.124407Z","title":"Discuss before moving: Visual language navigation via multi-expert discussions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.124407Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:ca3eafbb1a43ad8a8d51bcef1089dd2789740d7ef01b3ac8dc79fd3e336041bc","observation_id":"ae4c0ceb-7a80-412a-87d0-b5379d9e0139","resolution":{"observed_at":"2026-07-30T20:42:04.124407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.151044Z","title":"Deepstack: Deeply stacking visual tokens is surprisingly simple and effective for lmms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.151044Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:9a632b4228a28c81f8b13a9b593976a18c248d3b7545bcb72ba6ac254cab0879","observation_id":"80dd1ef7-0309-4364-90ea-9df1c482d955","resolution":{"observed_at":"2026-07-30T20:42:04.151044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.159862Z","title":"Reverie: Remote embodied visual referring expression in real indoor environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.159862Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:93d406a6c4beeb68ffc9b5326f6ed7f916d356fa7158ffe29820400436e2d14a","observation_id":"0d68cc44-7ddd-4136-8f03-60e9ada92ccc","resolution":{"observed_at":"2026-07-30T20:42:04.159862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.170592Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.170592Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:8abbd3e2b2b8af1a41efda65e37cb7fe826dfbe2a7344306a60588abe6e608f4","observation_id":"dfa1ae66-9b8d-43fe-b109-05de296d5261","resolution":{"observed_at":"2026-07-30T20:42:04.170592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08238","last_updated":"2021-09-16T22:01:24Z","snapshot_observed_at":"2026-07-06T11:48:35.206160Z","submitted_at":"2021-09-16T22:01:24Z","title":"Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08238","snapshot_observed_at":"2026-07-30T20:42:04.177491Z","title":"Habitat-matterport 3d dataset (hm3d): 1000 large-scale 3d environments for embodied ai.arXiv preprint arXiv:2109.08238, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.177491Z"},"links":{"cited_paper":"/paper/2109.08238","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:ce3065ddf0b937c81862ad1b524c45ef0f6beef2523cf2d6c7ed5b4c9acef959","observation_id":"7d4bb9c3-83df-4640-be24-8a1c883918ee","resolution":{"observed_at":"2026-07-30T20:42:04.177491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.183795Z","title":"Language- aligned waypoint (law) supervision for vision-and-language navigation in continuous envi- ronments","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.183795Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:83a89764dcdd65041959fa9998366deb2f5f9d380d47d83757eea2731b17a3d9","observation_id":"8f7755a6-a814-45d4-b3b8-f6871d6fb957","resolution":{"observed_at":"2026-07-30T20:42:04.183795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.190707Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.190707Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:ce29c5ee9d04730d495db17e47071bde76c85c98ee3105b2a13806f4c13df3ab","observation_id":"0d9ce42f-e30e-4f61-a6a1-c1de52d2c815","resolution":{"observed_at":"2026-07-30T20:42:04.190707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.199713Z","title":"Habitat: A platform for embodied ai research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.199713Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:1781df30cfa86093bcbf90edab241f03f9267aabfa457723c9924b3b3f580689","observation_id":"13fd62c1-a987-4850-a83e-dbb1fbd4111b","resolution":{"observed_at":"2026-07-30T20:42:04.199713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.210468Z","title":"Learning to navigate unseen environments: Back translation with environmental dropout","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.210468Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:21b421e58aa02d440d5a63eac86fca97662a64a0a547f04f2c13f2ea82ffe762","observation_id":"84ea8eb2-66f5-4c3b-a52c-24283fcd70d0","resolution":{"observed_at":"2026-07-30T20:42:04.210468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-07-30T20:42:04.226291Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.226291Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:5d501d490cded324df110151da25eb721edf29c5657d9ebd8e57a09398dcda62","observation_id":"3770f99d-138f-40ca-bceb-704b747b0121","resolution":{"observed_at":"2026-07-30T20:42:04.226291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.238540Z","title":"Vision-and-dialog navigation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.238540Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:03992aae6fd66576f4436b7bc4b6c63e50764503ca37b6f292ac42f9d8a06af7","observation_id":"10b9fe1e-98db-47c8-bd49-2c27f023c4c8","resolution":{"observed_at":"2026-07-30T20:42:04.238540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-30T20:42:04.245014Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.245014Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:7e36031329691f96173953c6b0d51269ee2be75858908d9a8f7cb99337a703e4","observation_id":"591f0d4e-cbb9-43e2-a3ed-f029809c1d62","resolution":{"observed_at":"2026-07-30T20:42:04.245014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.256233Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.256233Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:aa650852ee5b44bd933c017bbfa6409b20be8cc1c672bf2ec7a2017fe25da273","observation_id":"08aaa791-0068-497c-8215-4577669021dc","resolution":{"observed_at":"2026-07-30T20:42:04.256233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-30T20:42:04.265665Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.265665Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:726390acbcddf2533be9ca17d18419a6e1dfc063979b995083b8496a4b530f8a","observation_id":"b07c4916-dd03-4954-9ff0-9a49313f3033","resolution":{"observed_at":"2026-07-30T20:42:04.265665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.273325Z","title":"Gridmm: Grid memory map for vision-and-language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.273325Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:75d2ab3e0dedc854e01bce19a238966a3ba5f32fade5d50d7b97c03bbb8e1b34","observation_id":"b9ed50af-392c-4949-a1fb-6d13ddcc4585","resolution":{"observed_at":"2026-07-30T20:42:04.273325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.280485Z","title":"Lookahead exploration with neural radiance representation for continuous vision-language navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.280485Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:672378e8d5295c9c67c3efbe18da49911a8f3198fe88ffeb063ed3617d7afc1c","observation_id":"96636e53-13ff-47ef-b6f8-59243aed4443","resolution":{"observed_at":"2026-07-30T20:42:04.280485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09798","last_updated":"2024-10-14T04:48:18Z","snapshot_observed_at":"2026-07-06T18:30:50.693663Z","submitted_at":"2024-06-14T07:50:09Z","title":"Sim-to-Real Transfer via 3D Feature Fields for Vision-and-Language Navigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09798","snapshot_observed_at":"2026-07-30T20:42:04.289618Z","title":"Sim-to-real transfer via 3d feature fields for vision-and-language navigation.arXiv preprint arXiv:2406.09798, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.289618Z"},"links":{"cited_paper":"/paper/2406.09798","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:15eecb269959cc81424279ca94823d6c57725faf0b3710f32dd37f7b6422ab4b","observation_id":"0ff8670e-d957-4cdc-b122-94b3404acb98","resolution":{"observed_at":"2026-07-30T20:42:04.289618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.300070Z","title":"Scaling data generation in vision-and-language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.300070Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:b9e4086ef4b0892875db23d6d5e2e69478c74b1e4b9ab37b7b56482ef7bff4cf","observation_id":"997c602b-1ff2-4595-b5b4-bfde57e93136","resolution":{"observed_at":"2026-07-30T20:42:04.300070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-07-31T04:11:07.384159Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-30T20:42:04.312697Z","title":"Streamvln: Streaming vision-and-language navigation via slowfast context modeling.arXiv preprint arXiv:2507.05240, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.312697Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:8cf6cfb4f1f1dd432e9287047d1d6b334cf09c21d648232d781451c131454e32","observation_id":"5bd1de4b-18ff-4341-9a0f-39851b05a53f","resolution":{"observed_at":"2026-07-30T20:42:04.312697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.320554Z","title":"Gibson env: Real-world perception for embodied agents","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.320554Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:e3c51db208bafb78307da7e25e02130ff4173af70bdd623100b38ccdfce5b3ec","observation_id":"d85f88cc-a354-4a16-871c-53d9a16153ca","resolution":{"observed_at":"2026-07-30T20:42:04.320554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-07-06T20:03:42.903210Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06224","snapshot_observed_at":"2026-07-30T20:42:04.329176Z","title":"Uni-navid: A video-based vision-language-action model for unifying embodied navigation tasks.arXiv preprint arXiv:2412.06224, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.329176Z"},"links":{"cited_paper":"/paper/2412.06224","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:54d7d06db2320cf250d1fe656aaf2123717adbf4f1ec3f2af9fadc4c72ec5ecf","observation_id":"62381cda-58df-4449-8cfe-7b594c6a817f","resolution":{"observed_at":"2026-07-30T20:42:04.329176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-07-06T17:34:57.509162Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15852","snapshot_observed_at":"2026-07-30T20:42:04.335446Z","title":"Navid: Video-based vlm plans the next step for vision-and-language navigation.arXiv preprint arXiv:2402.15852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.335446Z"},"links":{"cited_paper":"/paper/2402.15852","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:168d8563f6e91eab97cdee5bdc4e9ef0dedf49aa0eaa5a251ace9d01c4d9f1a7","observation_id":"9018df27-be93-47a9-a72f-0f7de330cdc5","resolution":{"observed_at":"2026-07-30T20:42:04.335446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.343242Z","title":"Lyra: An efficient and speech-centric framework for omni-cognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.343242Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:2d18baf3c038ebefe8897476d3f37410850598fcb211ea80418bda6a734b3d2d","observation_id":"c87b155e-1dd5-4476-8cec-141e67f181fa","resolution":{"observed_at":"2026-07-30T20:42:04.343242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:42:04.352249Z","title":"Navgpt: Explicit reasoning in vision-and-language navigation with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.352249Z"},"links":{"citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:a63802b3cfdb2067a941a09505856ba430c9fb75a076f4fe05f22aac7fd41216","observation_id":"bd217528-721c-44f4-9ff0-27980426c0c5","resolution":{"observed_at":"2026-07-30T20:42:04.352249Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2607.23504."}