{"as_of":"2026-08-04T08:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83ebbda4a6d652ae12c6e128c4c3db0f406aaaa30482c84e072b6703572fa8b4","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:19:46.694802Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T03:24:25.215191Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.10383","snapshot_observed_at":"2026-08-01T00:43:27.294478Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26148","last_updated":"2026-08-03T01:02:45Z","snapshot_observed_at":"2026-08-04T08:29:22.266276Z","submitted_at":"2026-07-28T18:00:34Z","title":"Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T00:43:27.294478Z"},"links":{"cited_paper":"/paper/2607.10383","citing_paper":"/paper/2607.26148"},"observation_digest":"sha256:942b1b9f8695a727418801977e14b48a80da25800d3b2671329a9bb363211678","observation_id":"25261757-7e38-47d7-8624-7e27c07703b7","resolution":{"observed_at":"2026-08-01T00:43:27.294478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.10383","snapshot_observed_at":"2026-08-04T03:24:25.215191Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26148","last_updated":"2026-08-03T01:02:45Z","snapshot_observed_at":"2026-08-04T08:29:22.266276Z","submitted_at":"2026-07-28T18:00:34Z","title":"Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T03:24:25.215191Z"},"links":{"cited_paper":"/paper/2607.10383","citing_paper":"/paper/2607.26148"},"observation_digest":"sha256:fef6535cb70a9d99d65daa49e1975aad88f64727b1ba163561a60a1ce87ce464","observation_id":"3a8e0699-478c-4ebc-ae1a-20becba05d77","resolution":{"observed_at":"2026-08-04T03:24:25.215191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.10383/citation-record","integrity":"/paper/2607.10383/integrity","json":"/paper/2607.10383/citation-record.json","paper":"/paper/2607.10383"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2206.11610","last_updated":"2022-06-26T14:37:08Z","snapshot_observed_at":"2026-07-06T13:23:55.107856Z","submitted_at":"2022-06-23T10:36:53Z","title":"1st Place Solutions for RxR-Habitat Vision-and-Language Navigation Competition (CVPR 2022)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11610","snapshot_observed_at":"2026-08-02T07:19:36.808445Z","title":"1st place solutions for rxr-habitat vision-and-language navigation competition (cvpr 2022).arXiv preprint arXiv:2206.11610, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:36.808445Z"},"links":{"cited_paper":"/paper/2206.11610","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:7f9f0955cb0722fd774de6ad926c95e82c797c01ac33a6a4cb2b3f9fbfeacab3","observation_id":"adb8d8a6-5568-4bf9-b57d-d7983547f11e","resolution":{"observed_at":"2026-08-02T07:19:36.808445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:36.880741Z","title":"Etpnav: Evolving topological planning for vision-language navigation in continuous environments.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:36.880741Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:216b6a96874c64679cb3c9aa4b35da5557d7502e5ee7f95d0aed55276548f4ab","observation_id":"b6304653-9a51-4724-b28a-20db22fe21ce","resolution":{"observed_at":"2026-08-02T07:19:36.880741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:36.938706Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:36.938706Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:c9e40f8a375d79a54af42e2fd2856a336c18890e689122449108f61f0e0a2813","observation_id":"ec2a35d4-3b96-4de9-9bfe-a61f76517456","resolution":{"observed_at":"2026-08-02T07:19:36.938706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-02T07:19:36.990464Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:36.990464Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:fccf065667e2a19587d7d5efeb212fc03c0dd2542940ed2b4f2100773da8ea17","observation_id":"53affc0d-cfba-4b9c-9336-f00b74a31862","resolution":{"observed_at":"2026-08-02T07:19:36.990464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13171","last_updated":"2020-08-30T04:28:13Z","snapshot_observed_at":"2026-07-06T09:32:02.150002Z","submitted_at":"2020-06-23T17:18:54Z","title":"ObjectNav Revisited: On Evaluation of Embodied Agents Navigating to Objects","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.13171","snapshot_observed_at":"2026-08-02T07:19:37.070208Z","title":"Objectnav revisited: On evaluation of embodied agents navigating to objects.arXiv preprint arXiv:2006.13171, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.070208Z"},"links":{"cited_paper":"/paper/2006.13171","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:f96b8373e9cfb82b34ecbfe4758d690e79874f5306e48a14db91cd89edc73d18","observation_id":"0f34bf93-085e-4bd1-863e-09d364244fbe","resolution":{"observed_at":"2026-08-02T07:19:37.070208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:37.117575Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.117575Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:634a80e038560b71dc8c6d286fa6455012b5133b662b2e1b4317527d6dc531a8","observation_id":"826ef829-ab27-4aef-b0e6-544bf1774399","resolution":{"observed_at":"2026-08-02T07:19:37.117575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01953","last_updated":"2025-06-02T17:59:51Z","snapshot_observed_at":"2026-08-04T04:31:43.779807Z","submitted_at":"2025-06-02T17:59:51Z","title":"Fast-in-Slow: A Dual-System Foundation Model Unifying Fast Manipulation within Slow Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01953","snapshot_observed_at":"2026-08-02T07:19:37.181342Z","title":"Fast-in-slow: A dual-system foundation model unifying fast manipulation within slow reasoning.arXiv preprint arXiv:2506.01953, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.181342Z"},"links":{"cited_paper":"/paper/2506.01953","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:e98c01bf3cfb7a9ab418023f8ec2af221c48f215bbcd29b408a570743f2554f1","observation_id":"122a4698-8e1a-4fce-917b-11a3a3fad552","resolution":{"observed_at":"2026-08-02T07:19:37.181342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:37.263414Z","title":"Affordances-oriented planning using foundation models for continuous vision-language navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.263414Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:6abc926328d55b3400b59a10deb4ff990350eb96a3caa51eb152686c63bc87fd","observation_id":"86df4f93-2068-4319-ac8f-a1a774594377","resolution":{"observed_at":"2026-08-02T07:19:37.263414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21714","last_updated":"2026-04-08T16:31:40Z","snapshot_observed_at":"2026-08-03T01:54:32.856831Z","submitted_at":"2025-12-25T15:31:24Z","title":"AstraNav-World: World Model for Foresight Control and Consistency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.21714","snapshot_observed_at":"2026-08-02T07:19:37.335878Z","title":"Astranav-world: World model for foresight control and consistency, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.335878Z"},"links":{"cited_paper":"/paper/2512.21714","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:7ab83a4be2b5846956aa4aa035a0499f8752876d5e8e60576d5651fb81c17fc3","observation_id":"5125dade-d346-4bec-bbc3-7e6a973086a1","resolution":{"observed_at":"2026-08-02T07:19:37.335878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:37.400923Z","title":"Topological planning with transformers for vision-and-language navigation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.400923Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:d6a7da174dc54a7d1c6c6e84b77f73920d92035b605676670cc23be2cbba3b76","observation_id":"c1e8090a-5e9b-4c25-bf3f-76865e3d3d62","resolution":{"observed_at":"2026-08-02T07:19:37.400923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:37.487932Z","title":"Weakly- supervised multi-granularity map learning for vision-and-language navigation.Advances in Neural Information Processing Systems, 35:38149–38161, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.487932Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:8215730e2766313896f60e57436b81d3a438b23dc699671e0e26bb2679d53d41","observation_id":"ebb3fbdb-5ac6-4751-a227-0b18a806e801","resolution":{"observed_at":"2026-08-02T07:19:37.487932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:37.589776Z","title":"Explore like humans: Autonomous exploration with online sg-memo construction for embodied agents,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.589776Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:6d2dfd3d856424825173b240136371a5178c28c453d032fdf50a5cfd13e006d2","observation_id":"9525adab-4ff2-4b9a-9be7-4ae88c9da44b","resolution":{"observed_at":"2026-08-02T07:19:37.589776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:37.754962Z","title":"Socialnav: Training human-inspired foundation model for socially-aware embodied navigation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.754962Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:3484510ae54952bafe8461bf3dd1b2b77c18f11c4b768267523968baea9f2f48","observation_id":"ad62a71f-2a0d-447f-b742-d70398530c9a","resolution":{"observed_at":"2026-08-02T07:19:37.754962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:37.827587Z","title":"Socialnav: Training human-inspired foundation model for socially-aware embodied navigation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.827587Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:bd01320891587da1f56d62c521ab760306bf1cfe9c33beb43d025368d1adaac8","observation_id":"d4cd4a0c-1303-4220-bb7c-e8301ad32e1f","resolution":{"observed_at":"2026-08-02T07:19:37.827587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:37.918214Z","title":"Spatialrgpt: Grounded spatial reasoning in vision-language models.Advances in Neural Information Processing Systems, 37:135062–135093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.918214Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:d5fcc677cdbed3b902ae3ce88652e694e7335ca7a68c216cba81fe1681b33b4e","observation_id":"111dc39e-bfdb-495e-839a-0f743d99968b","resolution":{"observed_at":"2026-08-02T07:19:37.918214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:37.960793Z","title":"Navila: Legged robot vision-language-action model for navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.960793Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:45000cfa8d6ce67a07f5943b6e65c7e0c89a17426879315ab5f7d1fe0248b40d","observation_id":"2816f1cb-6124-4612-887f-33fc2ba2146c","resolution":{"observed_at":"2026-08-02T07:19:37.960793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07775","last_updated":"2024-07-12T14:37:08Z","snapshot_observed_at":"2026-07-06T18:44:20.262496Z","submitted_at":"2024-07-10T15:49:07Z","title":"Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07775","snapshot_observed_at":"2026-08-02T07:19:38.021123Z","title":"Mobility vla: Multimodal instruction navigation with long-context vlms and topological graphs.arXiv preprint arXiv:2407.07775, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.021123Z"},"links":{"cited_paper":"/paper/2407.07775","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:e8ce3bd015e4fd15f275a7cf778ee759ff844463e10fac077ff7fbcea9bd12dd","observation_id":"b23e3ce2-1839-463e-808a-8e25af104d0d","resolution":{"observed_at":"2026-08-02T07:19:38.021123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:38.081301Z","title":"Abot-n0: Technical report on the vla foundation model for versatile embodied navigation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.081301Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:98cf6b4878ce1da3c6c8b391db3d1356e11a3c68ff930ed7760d3bf587922f8c","observation_id":"4601b2dd-ff75-40ca-bb6f-ae604f0de3c0","resolution":{"observed_at":"2026-08-02T07:19:38.081301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:38.136227Z","title":"Vpn: Visual prompt navigation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.136227Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:e2a88ce8b996ee32784564c7b0ec897e4a6cb2b1d765a07f7b80a82f661ff28e","observation_id":"b3dd50d3-e7b1-43d0-88b9-d4473b4f9f1d","resolution":{"observed_at":"2026-08-02T07:19:38.136227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:38.216170Z","title":"Helix: A vision-language-action model for generalist humanoid control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.216170Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:1ace6fc24df26a68e09c10bfb9ffa41570678d527b382b5e05ae391a525f7a48","observation_id":"891b3320-bfeb-4dff-ad9b-346ee9c97ece","resolution":{"observed_at":"2026-08-02T07:19:38.216170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.28237","last_updated":"2026-05-27T09:50:16Z","snapshot_observed_at":"2026-08-01T20:05:46.834842Z","submitted_at":"2026-05-27T09:50:16Z","title":"POINav: Benchmarking and Enhancing Final-Meters Arrival in Real-World Vision-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.28237","snapshot_observed_at":"2026-08-02T07:19:38.321058Z","title":"Poinav: Benchmarking and enhancing final-meters arrival in real-world vision-language navigation.arXiv preprint arXiv:2605.28237, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.321058Z"},"links":{"cited_paper":"/paper/2605.28237","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:3792c233435ab330a286047175351ed334d0598cba5ff00e42372491f1b22184","observation_id":"3bbe455c-b2ac-4aee-81e2-8f0e24068f23","resolution":{"observed_at":"2026-08-02T07:19:38.321058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:38.370727Z","title":"Vision-and-language navigation: A survey of tasks, methods, and future directions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.370727Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:e08e63dad9e0eae42914d449f6276b1568ed40c2a0b259b397c14520ea60a8fe","observation_id":"84dc7f60-b8c4-40fa-9c95-7575481f4859","resolution":{"observed_at":"2026-08-02T07:19:38.370727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-02T07:19:38.433524Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.433524Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:ae3d35c8daf95e6fa42aa47f982289979c14fa5336206ef5dc1108d155b9a8dd","observation_id":"83394366-1244-42e5-bc9a-e593ebae063d","resolution":{"observed_at":"2026-08-02T07:19:38.433524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:38.441120Z","title":"A novel vision-based tracking algorithm for a human-following mobile robot.IEEE Transactions on Systems, Man, and Cybernetics: Systems, 47(7):1415–1427, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.441120Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:2acee5ff94afdbd62b3e9cfaeaf3a084cee9b6a004a218284c0a751da39deb41","observation_id":"faec5ddf-a971-4758-bd72-5d3f25e535ab","resolution":{"observed_at":"2026-08-02T07:19:38.441120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:38.449475Z","title":"Bridging the gap between learning in discrete and continuous environments for vision-and-language navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.449475Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:439f84e56a32ded6dd81f3b3dc36288c6b25d20aa7a8f8cc881c0e7dd78c2aab","observation_id":"1bfa2779-a80d-4126-a669-60a79fa00688","resolution":{"observed_at":"2026-08-02T07:19:38.449475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-02T07:19:38.498013Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.498013Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:e9db5c814134d81de79728a22605d721074ab32aad1a7fa490e63a0db2ef2c45","observation_id":"74343176-14e1-443d-bf2a-69a4e3d1a491","resolution":{"observed_at":"2026-08-02T07:19:38.498013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:38.592299Z","title":"A comprehensive review of recent advancements in vision-and-language navigation.Discover Computing, 29(1):167, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.592299Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:e2d74d61799460bae960265f460ecad85d1b3a4d97f67fdfb0cf396ac5b026b4","observation_id":"eb18c568-df6a-4dcd-b467-c79204643797","resolution":{"observed_at":"2026-08-02T07:19:38.592299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:38.749263Z","title":"Sim-2-sim transfer for vision-and-language navigation in continuous environments","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.749263Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:b1b617ffce1384f3c9601122a01bde1d130311adbebf9bb725e656badc0a0e54","observation_id":"a10459ff-3da6-4574-b3a3-2d57746b6d7e","resolution":{"observed_at":"2026-08-02T07:19:38.749263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:38.893334Z","title":"Beyond the nav-graph: Vision- and-language navigation in continuous environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:38.893334Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:7b677e1df0e49f0992b31dff03a517955119af3a0ddf580b25087f745525a154","observation_id":"92565456-8fbb-4f8b-ba79-4abbee239075","resolution":{"observed_at":"2026-08-02T07:19:38.893334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:39.022007Z","title":"Waypoint models for instruction-guided navigation in continuous environments","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:39.022007Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:18878a9fb5220ba2664dff53b21207cb49a1fb9771dc8f2bbd91cacf26226f3d","observation_id":"2e19769c-7526-40be-986e-9b7f4eaa3641","resolution":{"observed_at":"2026-08-02T07:19:39.022007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:39.190648Z","title":"Room-across-room: Multilingual vision-and-language navigation with dense spatiotemporal grounding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:39.190648Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:d9ee30bbad13a9505f41da3a0891748e087898a590df07a1d56e8c5cb079d32a","observation_id":"302cfabe-c7cb-4ee1-a8da-240a88e2ad90","resolution":{"observed_at":"2026-08-02T07:19:39.190648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:39.270648Z","title":"Large-scale model-enhanced vision-language navigation: Recent advances, practical applications, and future challenges.Sensors, 26(7):2022, 2026","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:39.270648Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:a5053eeaff842cd2d2c28fa79908ee72d5b67d6c5137a57d513df9dad92ba7b3","observation_id":"394ab79b-b505-4b3b-8678-4aa890450fdc","resolution":{"observed_at":"2026-08-02T07:19:39.270648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:39.467980Z","title":"Navcot: Boosting llm-based vision-and-language navigation via learning disentangled reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:39.467980Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:e756062f7bfe96e8486fed05f88b617a51acb3b2a7c28c2b29b03147af95f31f","observation_id":"ad0bed1f-a59d-45a7-ae5d-5c9f82e49d7e","resolution":{"observed_at":"2026-08-02T07:19:39.467980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:39.574382Z","title":"Conflict-averse gradient descent for multi-task learning.Advances in neural information processing systems, 34:18878–18890, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:39.574382Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:9e19f89c38c234315385239f788169343ced0cf38e533ca7ce0d6ee0f506ade8","observation_id":"156c63b7-23f7-4127-b6c8-34bb149e5a5d","resolution":{"observed_at":"2026-08-02T07:19:39.574382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:39.691873Z","title":"Navforesee: A unified vision-language world model for hierarchical planning and dual-horizon navigation prediction","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:39.691873Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:eb10faeafd2795bcd9299169f3211059375f5975edf04a9b9b6de204f98d4c22","observation_id":"50477096-bb03-49b9-8cb8-4eaab3decd3a","resolution":{"observed_at":"2026-08-02T07:19:39.691873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:39.799646Z","title":"Navforesee: A unified vision-language world model for hierarchical planning and dual-horizon navigation prediction","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:39.799646Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:b16758994d2f3222685245800c12bee1b3879861dc1da7d3b7b264ab0ca36733","observation_id":"90a00645-7917-432c-8dd8-0bb8d514a38d","resolution":{"observed_at":"2026-08-02T07:19:39.799646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:39.883480Z","title":"Trackvla++: Unleashing reasoning and memory capabilities in vla models for embodied visual tracking.arXiv preprint arXiv:2510.07134, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:39.883480Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:6785ebef06c75300933572c2651c6b71a8677929e5d60cf430d7ae9f60071418","observation_id":"ad2bda31-0b80-4a07-b4ce-0494b10127f7","resolution":{"observed_at":"2026-08-02T07:19:39.883480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:39.946903Z","title":"Citywalker: Learning embodied urban navigation from web-scale videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:39.946903Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:e2fa943539c4c5cb0e5dc409c5a625c1afec6fb19d95b93a9570dc5ca3401914","observation_id":"2bd60e77-0852-4b8a-8f26-986ca9ea610c","resolution":{"observed_at":"2026-08-02T07:19:39.946903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04882","last_updated":"2024-06-07T12:26:34Z","snapshot_observed_at":"2026-07-06T18:27:07.473039Z","submitted_at":"2024-06-07T12:26:34Z","title":"InstructNav: Zero-shot System for Generic Instruction Navigation in Unexplored Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04882","snapshot_observed_at":"2026-08-02T07:19:40.032137Z","title":"Instructnav: Zero-shot system for generic instruction navigation in unexplored environment.arXiv preprint arXiv:2406.04882, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:40.032137Z"},"links":{"cited_paper":"/paper/2406.04882","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:fcf9ed66c9b2ef62792e37dffc93778bb0f1af9a157efae127748b0b3238927c","observation_id":"5b425577-fa8e-4f88-904d-a268d96ded91","resolution":{"observed_at":"2026-08-02T07:19:40.032137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:40.091709Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:40.091709Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:e5c6deb44fa6adc2a5e81aba5cc8d98296a3caff05a95389d1db9d1fdba27e3c","observation_id":"f1c82efe-76e2-4865-85bc-b0e94dae1bf4","resolution":{"observed_at":"2026-08-02T07:19:40.091709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-02T07:19:40.319034Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots.arXiv preprint arXiv:2503.14734, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:40.319034Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:b640aa42fb426b14a1da16673a3d435b21fa16064350b8225697cf857e8ce1fe","observation_id":"187b3f55-7677-4926-9bf6-ff4120c9f179","resolution":{"observed_at":"2026-08-02T07:19:40.319034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05377","last_updated":"2026-06-28T10:51:16Z","snapshot_observed_at":"2026-08-02T22:18:25.610175Z","submitted_at":"2026-03-05T17:02:22Z","title":"OpenFrontier: General Navigation with Visual-Language Grounded Frontiers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05377","snapshot_observed_at":"2026-08-02T07:19:40.471855Z","title":"Openfrontier: General navigation with visual-language grounded frontiers.arXiv preprint arXiv:2603.05377, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:40.471855Z"},"links":{"cited_paper":"/paper/2603.05377","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:5611be07966e7105d061f942ec64183c81b1f4038fd6fc49b24159d603b5f5c3","observation_id":"1e0dc0c5-6860-45b1-8596-bf19425790df","resolution":{"observed_at":"2026-08-02T07:19:40.471855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:40.601537Z","title":"Habitat: A platform for embodied ai research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:40.601537Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:665d55f5b8173e5e21d147bc994d29a39c5db86bac7620e97fb707efb1d5a547","observation_id":"d087e6c2-8e6a-45eb-8ee1-879b33f5ea76","resolution":{"observed_at":"2026-08-02T07:19:40.601537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:40.794162Z","title":"Gnm: A general navigation model to drive any robot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:40.794162Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:6a3c7e3c1a901202bad44741adeca9de9dbf40f23e8837aab0eb319fb0fee38d","observation_id":"59ddb180-bbda-45af-b020-75ea7f9aff43","resolution":{"observed_at":"2026-08-02T07:19:40.794162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:41.001578Z","title":"Vint: A foundation model for visual navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:41.001578Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:1d3708738928e45380c498be8b35f90ef60a50e9329a22066b9330eb6b9cf31c","observation_id":"597f69b9-bd76-43ca-b68d-50b2c5ad3eac","resolution":{"observed_at":"2026-08-02T07:19:41.001578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-02T07:19:41.156501Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models.arXiv preprint arXiv:2502.19417, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:41.156501Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:747fdb2759141ec92cca0c6592f78175c4d690761ffa8d00394be1427011be53","observation_id":"7cadf22a-03b2-4143-8bf3-e1a1e5b5c8d7","resolution":{"observed_at":"2026-08-02T07:19:41.156501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-07-06T21:31:35.572708Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-02T07:19:41.336447Z","title":"Hume: Introducing system-2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:41.336447Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:e50ac424bebb121128cef3eba43ce812a9870ccd58f472e23e391cc46b873b4e","observation_id":"5efd68fd-27c8-462e-ab83-5827f5d3a342","resolution":{"observed_at":"2026-08-02T07:19:41.336447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:41.436082Z","title":"Nomad: Goal masked diffusion policies for navigation and exploration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:41.436082Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:6621e3df01af24c4b133c1e0208cc3f776398b0bdc8d4d705be06a417ee4b211","observation_id":"91b3af87-24f6-42c2-9a9f-42ec0f4198b5","resolution":{"observed_at":"2026-08-02T07:19:41.436082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:41.559440Z","title":"Emma-x: An embodied multimodal action model with grounded chain of thought and look-ahead spatial reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:41.559440Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:2bbbfd985926349db7f83d429c14cb190096946e5f45f65b511821be2b5faa6a","observation_id":"8a3f2dc4-a7f6-4331-a51e-a42b46d0a661","resolution":{"observed_at":"2026-08-02T07:19:41.559440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:41.747678Z","title":"Robobrain 2.0 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:41.747678Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:68b9d5877034d2da28cd2dd9344da55d3129ce5b47ce0a9a566093d6f8fc2a5d","observation_id":"0ddff957-a98c-47dc-a4ff-74feac8f942d","resolution":{"observed_at":"2026-08-02T07:19:41.747678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:41.949051Z","title":"Robobrain 2.5: Depth in sight, time in mind.arXiv preprint arXiv:2601.14352, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:41.949051Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:fb678eb516d2bac5e9e56367f2db507da69aa56577f78d98f98122c93a21c8c5","observation_id":"146d8fdc-2eca-462f-98c9-4d0503f45d03","resolution":{"observed_at":"2026-08-02T07:19:41.949051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:42.085991Z","title":"Drivevlm: The convergence of autonomous driving and large vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:42.085991Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:e20edeadfb23323ffe95f00fb1436a809da7e0e5ba537e120603bc4827c2c2e4","observation_id":"c17b63ee-6b9e-4f45-9987-cd14d64924f9","resolution":{"observed_at":"2026-08-02T07:19:42.085991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:42.224826Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:42.224826Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:e2606146dbd7e28f0710e7efa0d49c271fcc483d80aa12eb9557ee1d3c46d9d8","observation_id":"66d353e3-7077-4572-b75d-540e94739956","resolution":{"observed_at":"2026-08-02T07:19:42.224826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30280","last_updated":"2026-06-01T13:48:35Z","snapshot_observed_at":"2026-08-04T01:13:02.026321Z","submitted_at":"2026-05-28T17:36:31Z","title":"Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30280","snapshot_observed_at":"2026-08-02T07:19:42.400030Z","title":"Qwen-vla: Unifying vision-language-action modeling across tasks, environments, and robot embodiments.arXiv preprint arXiv:2605.30280, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:42.400030Z"},"links":{"cited_paper":"/paper/2605.30280","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:578c22e52abe7704721ff19122c4aebad2d50487e754830d8c13bd30cffcf239","observation_id":"441e92bc-1557-4a7d-a989-e32f160bb4ef","resolution":{"observed_at":"2026-08-02T07:19:42.400030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:42.537690Z","title":"Moge: Unlocking accurate monocular geometry estimation for open-domain images with optimal training supervision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:42.537690Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:56edd09edcc64cb3f8571d3ca81c6b5d80b70086ad4136a41b7655d07479ccec","observation_id":"7066ddf5-e0c3-4f18-b96d-5b2649a436d7","resolution":{"observed_at":"2026-08-02T07:19:42.537690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-07-06T21:32:47.853691Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-08-02T07:19:42.675991Z","title":"Trackvla: Embodied visual tracking in the wild.arXiv preprint arXiv:2505.23189, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:42.675991Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:87afa8454c25d8622616d70d012162495d3997d2af69c1bfec07a4c5c33d4662","observation_id":"d2a5e682-9c0f-4b86-b398-958e6ccf2a58","resolution":{"observed_at":"2026-08-02T07:19:42.675991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:42.887647Z","title":"Gridmm: Grid memory map for vision-and-language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:42.887647Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:fb60894059aacded1de6dd6e9a3d652efc300fdf2fc003293419143a4a06c390","observation_id":"1d498e91-58a5-4e3f-abee-5514a3f38ab6","resolution":{"observed_at":"2026-08-02T07:19:42.887647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:43.042916Z","title":"Lookahead exploration with neural radiance representation for continuous vision-language navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:43.042916Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:7a188d588a5b7a39a08df159f8eea2765e576f2604fc11e0142fe31cead7f89a","observation_id":"f5bd57f7-9021-4d13-9c35-84914e1681f7","resolution":{"observed_at":"2026-08-02T07:19:43.042916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:43.223398Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:43.223398Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:7f5ced8b46a6b15621909c5580bf87beab8a32dab22e7ac84f7984f190450b9a","observation_id":"343b73d3-f947-49f5-af83-c92c35158c7b","resolution":{"observed_at":"2026-08-02T07:19:43.223398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:43.356041Z","title":"Ground slow, move fast: A dual-system foundation model for generalizable vision-and-language navigation.arXiv preprint arXiv:2512.08186, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:43.356041Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:ca247677b1e853e136fca7b1db889c4d7c215b6501fda04f92bbe57a8a9b793b","observation_id":"13e2aa2c-7a73-4bdb-8fe8-13be17d0adbe","resolution":{"observed_at":"2026-08-02T07:19:43.356041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-07-31T04:11:07.384159Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-08-02T07:19:43.503753Z","title":"Streamvln: Streaming vision-and-language navigation via slowfast context modeling.arXiv preprint arXiv:2507.05240, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:43.503753Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:bf993c28f5eb164715b7a9ffaea9344fd6bcde812ebf17d06d70960af808b9c7","observation_id":"35ace54b-82f0-409c-bcfd-8e99ef9ab06b","resolution":{"observed_at":"2026-08-02T07:19:43.503753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:43.638832Z","title":"Nav-r2 dual-relation reasoning for generalizable open-vocabulary object-goal navigation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:43.638832Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:6f1df8b770edf6d157a842cb6b78dce605667a94e4c6e325a521370ec5b0f5ef","observation_id":"4bc63c77-f5ad-48e3-b10e-f20deda7c58c","resolution":{"observed_at":"2026-08-02T07:19:43.638832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:43.887148Z","title":"Omninav: A unified framework for prospective exploration and visual-language navigation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:43.887148Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:f7cad122202586ff2ac8fd45cfcca9b55d7af651039b00727dafcd6ecf198ded","observation_id":"f240ba48-7982-4785-a6eb-3933a3dfd00e","resolution":{"observed_at":"2026-08-02T07:19:43.887148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:44.163112Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:44.163112Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:142c3780d5e58198ce156a6f643390e15b807d908282d6d7ec3eaa873852acad","observation_id":"b3c11b26-4533-4378-870a-ed559ff17874","resolution":{"observed_at":"2026-08-02T07:19:44.163112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24086","last_updated":"2026-04-27T06:20:15Z","snapshot_observed_at":"2026-08-03T03:51:20.015005Z","submitted_at":"2026-04-27T06:20:15Z","title":"AsyncShield: A Plug-and-Play Edge Adapter for Asynchronous Cloud-based VLA Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24086","snapshot_observed_at":"2026-08-02T07:19:44.848057Z","title":"Asyncshield: A plug-and-play edge adapter for asynchronous cloud-based vla navigation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:44.848057Z"},"links":{"cited_paper":"/paper/2604.24086","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:a9914edcd64df146a165750e797e738595a0ecc82778fb37feb3df771bedd9a7","observation_id":"f87437b6-e352-4f3e-88cb-186f17837e35","resolution":{"observed_at":"2026-08-02T07:19:44.848057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:44.595755Z","title":"Ce-nav: Flow-guided reinforcement refinement for cross-embodiment local navigation.arXiv preprint arXiv:2509.23203, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:44.595755Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:0d39dbc2018e43b8ed5dc7ef5e3dabe9ad5049add52084984edd5a462d6ef0ac","observation_id":"fb7e05a8-f520-459b-ae16-e2e899d97805","resolution":{"observed_at":"2026-08-02T07:19:44.595755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:45.185975Z","title":"Gradient surgery for multi-task learning.Advances in neural information processing systems, 33:5824–5836, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:45.185975Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:62f76d0d78884050426a5cfdb67743a9782626fd60a2d994720b8e40047322b2","observation_id":"c5740e3e-0e1e-4ceb-84d7-b7bf2ee97dee","resolution":{"observed_at":"2026-08-02T07:19:45.185975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:45.033252Z","title":"Hm3d-ovon: A dataset and benchmark for open-vocabulary object goal navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:45.033252Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:07506c4c5c3c936b300caf6ea0b5fcb8e4613f2159ea2557cfaa7c522eab1f35","observation_id":"dd6cb1f0-d359-4913-aeb3-9fb9a95af901","resolution":{"observed_at":"2026-08-02T07:19:45.033252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:45.353049Z","title":"Robotic control via embodied chain-of-thought reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:45.353049Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:33c7100c03188302f654a4a3584a3c8930bcff40764327c9f1a29a89ba7e5396","observation_id":"0032cf60-d307-4307-a2a7-0583942824a2","resolution":{"observed_at":"2026-08-02T07:19:45.353049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:45.272916Z","title":"Correctnav: Self-correction flywheel empowers vision-language-action navigation model","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:45.272916Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:b2758066bf48fae344501012e50dabb0872692e3ae48c4d09da912bbd3638f9d","observation_id":"c1ffa229-320e-430d-820c-a04ef96401db","resolution":{"observed_at":"2026-08-02T07:19:45.272916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-07-06T20:03:42.903210Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06224","snapshot_observed_at":"2026-08-02T07:19:45.554365Z","title":"Uni-navid: A video-based vision-language-action model for unifying embodied navigation tasks.arXiv preprint arXiv:2412.06224, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:45.554365Z"},"links":{"cited_paper":"/paper/2412.06224","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:ad3ac31276620d3c58860b12ee58f0116ca53cb115a5526daf1915b6e38069b3","observation_id":"bfdbe320-9b50-442c-89dc-f11389031e3d","resolution":{"observed_at":"2026-08-02T07:19:45.554365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20083","last_updated":"2024-06-28T17:51:10Z","snapshot_observed_at":"2026-07-06T18:38:38.104034Z","submitted_at":"2024-06-28T17:51:10Z","title":"PoliFormer: Scaling On-Policy RL with Transformers Results in Masterful Navigators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20083","snapshot_observed_at":"2026-08-02T07:19:45.435794Z","title":"Poliformer: Scaling on-policy rl with transformers results in masterful navigators.arXiv preprint arXiv:2406.20083, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:45.435794Z"},"links":{"cited_paper":"/paper/2406.20083","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:b950d469afdbbb151d2dbfad88a652a41e2566e2890835239a75aca256bd0c08","observation_id":"f45fc376-bbdd-4e1b-bf69-de16055f0d5f","resolution":{"observed_at":"2026-08-02T07:19:45.435794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:45.893363Z","title":"Embodied navigation foundation model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:45.893363Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:32409f6871ba05f78e4b13b7cb240e8567eded2d62dab52650100c13713ec53c","observation_id":"510c865f-b4da-407a-b17f-b9ddbceb467d","resolution":{"observed_at":"2026-08-02T07:19:45.893363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-07-06T17:34:57.509162Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15852","snapshot_observed_at":"2026-08-02T07:19:45.694354Z","title":"Navid: Video-based vlm plans the next step for vision-and-language navigation.arXiv preprint arXiv:2402.15852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:45.694354Z"},"links":{"cited_paper":"/paper/2402.15852","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:17203de6eb9c8109e827e5e69b22c009fd90d9357f6b370c7d7b53bca1310f32","observation_id":"84b45b46-bdc3-4a0e-bfa2-c00f9278b93b","resolution":{"observed_at":"2026-08-02T07:19:45.694354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:46.111431Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:46.111431Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:99051c201565ad103083c40922919b27997bf8cb1db427ecf23e6624b508098e","observation_id":"c4a90c1c-ddee-426a-bd76-fac3191b2434","resolution":{"observed_at":"2026-08-02T07:19:46.111431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.18112","last_updated":"2026-06-29T05:42:10Z","snapshot_observed_at":"2026-07-06T23:53:36.096914Z","submitted_at":"2026-06-16T16:17:44Z","title":"Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.18112","snapshot_observed_at":"2026-08-02T07:19:45.977650Z","title":"Qwen-robotnav technical report: A scalable navigation model designed for an agentic navigation system.arXiv preprint arXiv:2606.18112, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:45.977650Z"},"links":{"cited_paper":"/paper/2606.18112","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:69af8683fcc4bf27062a6848b384962f16d8b85b07cfd6752d35445dcb68af90","observation_id":"59865f02-98db-450f-8038-67d1c7f55cd0","resolution":{"observed_at":"2026-08-02T07:19:45.977650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:46.494248Z","title":"Navgpt-2: Unleashing navigational reasoning capability for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:46.494248Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:9e67536ed72b377d86994ad53e9e7718cdc69b157f6984f0f455b1c994c7b705","observation_id":"1b2f08d2-583e-427c-bc98-06e325f44c00","resolution":{"observed_at":"2026-08-02T07:19:46.494248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:46.276765Z","title":"Empowering embodied visual tracking with visual foundation models and offline rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:46.276765Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:0fa669483541252b3792915b8a6b05acdc2078e0363f764b264a1c0c407d0013","observation_id":"3c065a18-e89e-4221-b477-1683adbf7e21","resolution":{"observed_at":"2026-08-02T07:19:46.276765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:19:46.694802Z","title":"Fantasyvln: Unified multimodal chain-of-thought reasoning for vision-and-language navigation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:46.694802Z"},"links":{"citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:88e7142a27556e1b0dc8aa74c6ee0d173dd20ca9bd17ce825f7e431611390270","observation_id":"e57645ce-5f1f-40f3-8174-76c56f8fb83f","resolution":{"observed_at":"2026-08-02T07:19:46.694802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19034","last_updated":"2026-04-21T03:35:31Z","snapshot_observed_at":"2026-08-03T05:43:02.706048Z","submitted_at":"2026-04-21T03:35:31Z","title":"Explore Like Humans: Autonomous Exploration with Online SG-Memo Construction for Embodied Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.19034","snapshot_observed_at":"2026-08-02T07:19:37.659711Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:37.659711Z"},"links":{"cited_paper":"/paper/2604.19034","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:de0817b0b7ce52c28d449910368c35392a4ba6c7063792a2d611203c80ba55d7","observation_id":"d5937e12-c0c7-4f15-b192-086bebb1c23e","resolution":{"observed_at":"2026-08-02T07:19:37.659711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T04:32:28.477049Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":80,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 2 inbound Pith citation observations for arXiv:2607.10383."}