{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:562KRE5EV4OBQUKGERQ4VCC3TP","short_pith_number":"pith:562KRE5E","schema_version":"1.0","canonical_sha256":"efb4a893a4af1c1851462461ca885b9bda0a22262ca6d81eaf8bfbf4b8579bbc","source":{"kind":"arxiv","id":"2607.10383","version":1},"attestation_state":"computed","paper":{"title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.RO"],"primary_cat":"cs.CV","authors_text":"Chenlin Ming, Di Jing, Fei Liu, Guoqing Liu, Honglin Han, Hongyu Pan, Huachong Pang, Jiahao Shi, Jia Lu, Jianfang Zhang, Jintao Kong, Jiyue Tao, Junjun Hu, Kuan Yang, Menglin Yang, Mingchao Sun, Minghua Luo, Mingyang Yin, Minqi Gu, Mu Xu, Ruiyan Gong, Tianlun Li, Wei Guo, Wei Mei, Weize Li, Xiangpo Yang, Xiaolong Wu, Xiaoxiao Geng, Xiaoxu Leng, Yanfen Shen, Yanghong Chen, Yanqing Zhu, Ye He, Yingnan Guo, Zedong Chu, Zeqian Ye, Zhengbo Wang, Zhicheng Liu, Zhining Gu, Zihao Guan","submitted_at":"2026-07-11T16:21:03Z","abstract_excerpt":"Visual Language Navigation foundation models aim to unify deep reasoning for grounded spatial decisions with broad versatility for diverse embodied tasks. Current approaches typically achieve this integration via monolithic policies that map observations directly to actions, yet they often suffer from coordinate drift and poor handling of long-tail semantics. Furthermore, these black-box mappings lack interpretability, hindering the simultaneous achievement of generality, robustness, and transparency. We present ABot-N1, a step toward a general Visual Language Navigation foundation model, that"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2607.10383","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2026-07-11T16:21:03Z","cross_cats_sorted":["cs.AI","cs.RO"],"title_canon_sha256":"27951762688f9719e0c30b847991809676e9dfc3041f1b7fde473ca34a5a94dd","abstract_canon_sha256":"03304aed91d7c1744f090164e37e2781d185212a068919ad7e8a645b93665d6f"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-14T01:21:13.332093Z","signature_b64":"xMkXhsmjhIWd50IWEV018rwn9s+74Iq3H3dWJSh7y6dORKCiK3Vnd6ZUqH1EtjqgcSSPomcLgbITUkNf2Y6gDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"efb4a893a4af1c1851462461ca885b9bda0a22262ca6d81eaf8bfbf4b8579bbc","last_reissued_at":"2026-07-14T01:21:13.331293Z","signature_status":"signed_v1","first_computed_at":"2026-07-14T01:21:13.331293Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.RO"],"primary_cat":"cs.CV","authors_text":"Chenlin Ming, Di Jing, Fei Liu, Guoqing Liu, Honglin Han, Hongyu Pan, Huachong Pang, Jiahao Shi, Jia Lu, Jianfang Zhang, Jintao Kong, Jiyue Tao, Junjun Hu, Kuan Yang, Menglin Yang, Mingchao Sun, Minghua Luo, Mingyang Yin, Minqi Gu, Mu Xu, Ruiyan Gong, Tianlun Li, Wei Guo, Wei Mei, Weize Li, Xiangpo Yang, Xiaolong Wu, Xiaoxiao Geng, Xiaoxu Leng, Yanfen Shen, Yanghong Chen, Yanqing Zhu, Ye He, Yingnan Guo, Zedong Chu, Zeqian Ye, Zhengbo Wang, Zhicheng Liu, Zhining Gu, Zihao Guan","submitted_at":"2026-07-11T16:21:03Z","abstract_excerpt":"Visual Language Navigation foundation models aim to unify deep reasoning for grounded spatial decisions with broad versatility for diverse embodied tasks. Current approaches typically achieve this integration via monolithic policies that map observations directly to actions, yet they often suffer from coordinate drift and poor handling of long-tail semantics. Furthermore, these black-box mappings lack interpretability, hindering the simultaneous achievement of generality, robustness, and transparency. We present ABot-N1, a step toward a general Visual Language Navigation foundation model, that"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2607.10383","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2607.10383/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2607.10383","created_at":"2026-07-14T01:21:13.331697+00:00"},{"alias_kind":"arxiv_version","alias_value":"2607.10383v1","created_at":"2026-07-14T01:21:13.331697+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2607.10383","created_at":"2026-07-14T01:21:13.331697+00:00"},{"alias_kind":"pith_short_12","alias_value":"562KRE5EV4OB","created_at":"2026-07-14T01:21:13.331697+00:00"},{"alias_kind":"pith_short_16","alias_value":"562KRE5EV4OBQUKG","created_at":"2026-07-14T01:21:13.331697+00:00"},{"alias_kind":"pith_short_8","alias_value":"562KRE5E","created_at":"2026-07-14T01:21:13.331697+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/562KRE5EV4OBQUKGERQ4VCC3TP","json":"https://pith.science/pith/562KRE5EV4OBQUKGERQ4VCC3TP.json","graph_json":"https://pith.science/api/pith-number/562KRE5EV4OBQUKGERQ4VCC3TP/graph.json","events_json":"https://pith.science/api/pith-number/562KRE5EV4OBQUKGERQ4VCC3TP/events.json","paper":"https://pith.science/paper/562KRE5E"},"agent_actions":{"view_html":"https://pith.science/pith/562KRE5EV4OBQUKGERQ4VCC3TP","download_json":"https://pith.science/pith/562KRE5EV4OBQUKGERQ4VCC3TP.json","view_paper":"https://pith.science/paper/562KRE5E","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2607.10383&json=true","fetch_graph":"https://pith.science/api/pith-number/562KRE5EV4OBQUKGERQ4VCC3TP/graph.json","fetch_events":"https://pith.science/api/pith-number/562KRE5EV4OBQUKGERQ4VCC3TP/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/562KRE5EV4OBQUKGERQ4VCC3TP/action/timestamp_anchor","attest_storage":"https://pith.science/pith/562KRE5EV4OBQUKGERQ4VCC3TP/action/storage_attestation","attest_author":"https://pith.science/pith/562KRE5EV4OBQUKGERQ4VCC3TP/action/author_attestation","sign_citation":"https://pith.science/pith/562KRE5EV4OBQUKGERQ4VCC3TP/action/citation_signature","submit_replication":"https://pith.science/pith/562KRE5EV4OBQUKGERQ4VCC3TP/action/replication_record"}},"created_at":"2026-07-14T01:21:13.331697+00:00","updated_at":"2026-07-14T01:21:13.331697+00:00"}