{"as_of":"2026-08-08T21:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:880ee26abc273231ceff3a771453785c1aaff5db9576bcef96c6cfd09cee665c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":76,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:22:21.019683Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:09:43.511252Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:792c0673f2fc888088e86f9f88be83f2f61c60cd7b3b3cbec70409e6822f8f18","observation_id":"fac3d417-f91f-4a1e-a41c-8d39f05ae5cc","resolution":{"observed_at":"2026-05-23T07:42:43.167538Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:faafd207c0cb864c4a6f4b6de1e8196703b6e4924ff0f1c7efa8ce5d6083f613","observation_id":"836504b2-6e5d-48a7-9dc3-fa941533a835","resolution":{"observed_at":"2026-05-11T08:52:31.934448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:2250286ce8d91f102e88d0e1f0bc2059c596d7e0bf5aff7e2166e071be317a69","observation_id":"64d3b1c8-7ccc-47a6-9849-95ad8e8a46b4","resolution":{"observed_at":"2026-05-22T18:05:00.989303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T14:22:21.019683Z","title":"Cheng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19214","last_updated":"2025-08-28T13:09:08Z","snapshot_observed_at":"2026-08-07T14:16:32.890745Z","submitted_at":"2025-05-25T16:21:19Z","title":"Omni-Perception: Omnidirectional Collision Avoidance for Legged Locomotion in Dynamic Environments","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:21.019683Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2505.19214"},"observation_digest":"sha256:2961f91f20934ac742d3bb359e3d712dc76e4bedf1c442fed0ad8c4db12ce6dc","observation_id":"6e5caf3e-bffc-4b63-a42d-14a7215d9f47","resolution":{"observed_at":"2026-08-07T14:22:21.019683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T13:52:05.254189Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-08T02:45:56.557199Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.254189Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:d7b4811506340a3ba4293b3e39379c9e452c356a971c68e8fd01567c09101148","observation_id":"c73ab88c-39f1-44a1-b111-8abc20fdbeba","resolution":{"observed_at":"2026-08-07T13:52:05.254189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T13:40:16.513264Z","title":"Navila: Legged robot vision-language-action model for navigation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21594","last_updated":"2025-05-27T14:55:16Z","snapshot_observed_at":"2026-08-07T13:28:18.126229Z","submitted_at":"2025-05-27T14:55:16Z","title":"Fast and Cost-effective Speculative Edge-Cloud Decoding with Early Exits","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:16.513264Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2505.21594"},"observation_digest":"sha256:8459d7e150a2bacc879c185890e0004689028e33c8956ec8a41af95abdb5af6d","observation_id":"59f4dc6f-7814-4d5a-8ac6-845a407fbd16","resolution":{"observed_at":"2026-08-07T13:40:16.513264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T12:58:39.930337Z","title":"Cheng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.930337Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:94b4c1c94844411ecf9adce92329f15f05fcd7d46000474a0de9a069614b7685","observation_id":"2eef2a0e-9ef3-4ab0-ba8c-0c7f41be2c87","resolution":{"observed_at":"2026-08-07T12:58:39.930337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T12:16:09.666040Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-08T15:03:06.735553Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.666040Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:fc242a2a54ebb88f79514ee05eb8879267617c507663b8e6b9a652f7ea6d45a0","observation_id":"38816cc3-5d58-4c66-9782-0b54dcd0d5d0","resolution":{"observed_at":"2026-08-07T12:16:09.666040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T12:11:51.175126Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.175126Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:713ca9b5f61f8abe9634572db6914ff43d2f4391af96ca3bdf63e2aaf22f26d6","observation_id":"396dad35-108d-4f25-beea-2953d1be9b1d","resolution":{"observed_at":"2026-08-07T12:11:51.175126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2506.07339","last_updated":"2025-12-05T07:35:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T01:01:59Z","title":"Real-Time Execution of Action Chunking Flow Policies","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T14:18:51.613045Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.07339"},"observation_digest":"sha256:6689560976b20938be63f7204f0a7e1ba0a3a467982e612b14454ec9ca27bf68","observation_id":"c65785dc-dc54-48cc-8a95-cbdfc092f495","resolution":{"observed_at":"2026-05-15T14:18:51.663506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T04:44:40.740461Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09839","last_updated":"2025-06-11T15:15:17Z","snapshot_observed_at":"2026-08-07T23:59:45.702444Z","submitted_at":"2025-06-11T15:15:17Z","title":"OctoNav: Towards Generalist Embodied Navigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:40.740461Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.09839"},"observation_digest":"sha256:9d738c0f3a99ed30c61e2f497be529fed6022cac3d1e318149d9cfbcf3d0da67","observation_id":"d427094e-e49b-4e57-8b62-ef3e1532db70","resolution":{"observed_at":"2026-08-07T04:44:40.740461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T00:23:00.630568Z","title":"Navila: Legged robot vision-language-action model for navigation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-07T00:15:22.394070Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:00.630568Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:245289c1adc325732c4288aeaf4be2f4b254fb2a56942313e1aa142e44eb601b","observation_id":"ed17b4aa-87dc-430f-a22e-7824d1b5cc3f","resolution":{"observed_at":"2026-08-07T00:23:00.630568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-06T21:59:52.812767Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.812767Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:dd0859596629a72f5b9e69c350e3dbf230d1549e1aeefa7625b48b6de47daafb","observation_id":"c7e8f828-9987-4e2f-887e-4330e5f0a59c","resolution":{"observed_at":"2026-08-06T21:59:52.812767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2507.01925","last_updated":"2025-07-02T17:34:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:34:52Z","title":"A Survey on Vision-Language-Action Models: An Action Tokenization Perspective","version":1},"reference_index":153,"source":"pdf_text","source_observed_at":"2026-05-17T14:08:34.893876Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2507.01925"},"observation_digest":"sha256:4dd8d28c68249c5ad219f53de788275a4a778bd937f67130b656cc38ff6b455e","observation_id":"80347b0f-17f0-42af-ba60-2eea9961e4d0","resolution":{"observed_at":"2026-05-17T14:08:35.152944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-06T19:01:24.035518Z","title":"Navila: Legged robot vision-language- action model for navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06747","last_updated":"2025-07-09T11:02:46Z","snapshot_observed_at":"2026-08-06T18:52:58.435909Z","submitted_at":"2025-07-09T11:02:46Z","title":"LOVON: Legged Open-Vocabulary Object Navigator","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:01:24.035518Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2507.06747"},"observation_digest":"sha256:bd55db72e0eddd2ec4c93caf215fa6c13d78e06eb070a55826bf5749d66e06d3","observation_id":"ce5d2b74-c720-4015-ae13-4a7af8fd3cc0","resolution":{"observed_at":"2026-08-06T19:01:24.035518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-06T18:30:47.046180Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08224","last_updated":"2025-07-20T05:22:14Z","snapshot_observed_at":"2026-08-06T18:21:12.044757Z","submitted_at":"2025-07-11T00:17:08Z","title":"Making VLMs More Robot-Friendly: Self-Critical Distillation of Low-Level Procedural Reasoning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:30:47.046180Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2507.08224"},"observation_digest":"sha256:e37dd5313940e4cd64d056989b5c0756391a2d7520182b7d8727887c752be90e","observation_id":"74ba35c4-3fda-4de6-8faf-1e5eeae78498","resolution":{"observed_at":"2026-08-06T18:30:47.046180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-06T17:33:08.649485Z","title":"Navila: Legged robot vision-language-action model for navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.649485Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:3c28db0b95eab966fd54d3b8f6a390355ed16ef40e2102e6ec6b5f2a04600fd9","observation_id":"1a6cdeb1-03f9-4203-8b30-d80f04486d72","resolution":{"observed_at":"2026-08-06T17:33:08.649485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-05T22:50:43.715480Z","title":"Cheng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06426","last_updated":"2025-08-08T16:14:01Z","snapshot_observed_at":"2026-08-07T03:09:20.958694Z","submitted_at":"2025-08-08T16:14:01Z","title":"Shortcut Learning in Generalist Robot Policies: The Role of Dataset Diversity and Fragmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T22:50:43.715480Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2508.06426"},"observation_digest":"sha256:16a14e1a78408e08b27666006952c3e7944aed156c0bf268bf2bbf64e4638166","observation_id":"0ee95326-0488-4216-a12b-b8dff9a04446","resolution":{"observed_at":"2026-08-05T22:50:43.715480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-05T22:46:42.049089Z","title":"Cheng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06429","last_updated":"2025-08-08T16:16:43Z","snapshot_observed_at":"2026-08-06T08:09:31.684688Z","submitted_at":"2025-08-08T16:16:43Z","title":"SPARSE Data, Rich Results: Few-Shot Semi-Supervised Learning via Class-Conditioned Image Translation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T22:46:42.049089Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2508.06429"},"observation_digest":"sha256:b73dbe7c2cdfec3cc9c5376e018b88aaedfc98191b15be320eca8bb1e0d05008","observation_id":"a42816a0-a620-41d5-9747-aa27b76a829a","resolution":{"observed_at":"2026-08-05T22:46:42.049089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-05T20:31:07.196850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10416","last_updated":"2025-08-14T07:39:26Z","snapshot_observed_at":"2026-08-08T02:28:41.150453Z","submitted_at":"2025-08-14T07:39:26Z","title":"CorrectNav: Self-Correction Flywheel Empowers Vision-Language-Action Navigation Model","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:07.196850Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2508.10416"},"observation_digest":"sha256:218a6963e87929af3904248e6932381c2e46d18d3b0204faf86213a716079c4a","observation_id":"ded1f365-b984-4087-a96d-a245e3a528f9","resolution":{"observed_at":"2026-08-05T20:31:07.196850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-05T19:54:56.869301Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11476","last_updated":"2025-08-15T13:44:56Z","snapshot_observed_at":"2026-08-07T16:52:47.993111Z","submitted_at":"2025-08-15T13:44:56Z","title":"SPG: Style-Prompting Guidance for Style-Specific Content Creation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:56.869301Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2508.11476"},"observation_digest":"sha256:579f88dde4f0553ff7bc020cdba73dbb6e756df7d23d083793dc6800f37e8356","observation_id":"f291dc62-9fa7-4f61-b385-8632ae5e69f7","resolution":{"observed_at":"2026-08-05T19:54:56.869301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-05T19:06:28.436191Z","title":"NaVILA: Legged Robot Vision-Language- Action Model for Navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13446","last_updated":"2026-06-08T21:52:42Z","snapshot_observed_at":"2026-08-07T21:58:57.623091Z","submitted_at":"2025-08-19T02:01:06Z","title":"CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:28.436191Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2508.13446"},"observation_digest":"sha256:6c16028647c180731abfabe0c3c75dc7dc63ea0d3558863bf2fe49211368f34b","observation_id":"c7b4a824-620b-40e8-989f-60541a878e8f","resolution":{"observed_at":"2026-08-05T19:06:28.436191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-05T13:54:49.258914Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00210","last_updated":"2025-08-29T19:47:25Z","snapshot_observed_at":"2026-08-05T13:54:44.318912Z","submitted_at":"2025-08-29T19:47:25Z","title":"Beyond Pixels: Introducing Geometric-Semantic World Priors for Video-based Embodied Models via Spatio-temporal Alignment","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T13:54:49.258914Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2509.00210"},"observation_digest":"sha256:4d81d538d916f2e5b63c92a9db16779b690d80dcb480edd6370d7760451e9aea","observation_id":"dc10f7e0-86da-404d-8597-82dfcfea904a","resolution":{"observed_at":"2026-08-05T13:54:49.258914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-05T12:59:02.133626Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-07T21:46:58.502468Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:02.133626Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:7333544d682276ae395fc8ece4ccfa9da7066bfd39b2b5b94716ed440a7d6695","observation_id":"347d0f17-a116-4e37-9d7f-8a777b4109dd","resolution":{"observed_at":"2026-08-05T12:59:02.133626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-04T17:31:38.800522Z","title":"Navila: Legged robot vision-language- action model for navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-06T23:06:21.884601Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:38.800522Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:04689d5c8936981da771a1731c624703222604c5a843b957e650f6e7857dceb9","observation_id":"6eb69b24-e8c1-4332-bb3e-2b5f293abe54","resolution":{"observed_at":"2026-08-04T17:31:38.800522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2510.08547","last_updated":"2026-04-29T08:33:26Z","snapshot_observed_at":"2026-08-02T09:22:46.822482Z","submitted_at":"2025-10-09T17:55:44Z","title":"R2RGEN: Real-to-Real 3D Data Generation for Spatially Generalized Manipulation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T08:46:51.278024Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2510.08547"},"observation_digest":"sha256:909308173968bf9c1aa879958dbb910e56044d27bd3b760129da9391acf66045","observation_id":"64ed98ce-ebd6-4121-af1d-d60f1761d8ef","resolution":{"observed_at":"2026-05-18T08:51:09.111792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2511.17097","last_updated":"2026-04-14T15:21:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-21T09:52:07Z","title":"Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T21:02:38.013115Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2511.17097"},"observation_digest":"sha256:bfd31d125a7f169ba6a3cce08a3b26bf2a88139a6d1afaa42b5aa8f9309df4f4","observation_id":"3fe1c212-e7fd-4c3c-8912-a7930b086f03","resolution":{"observed_at":"2026-05-17T21:05:15.979141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2512.21714","last_updated":"2026-04-08T16:31:40Z","snapshot_observed_at":"2026-08-03T01:54:32.856831Z","submitted_at":"2025-12-25T15:31:24Z","title":"AstraNav-World: World Model for Foresight Control and Consistency","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T19:23:58.769472Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2512.21714"},"observation_digest":"sha256:2d8e99fd4365d5de32fd99c2bf6bb0234b99a4ab466901d4d587b58954db5041","observation_id":"22394142-5144-4124-9272-e14f4f880d3f","resolution":{"observed_at":"2026-05-16T19:28:20.825261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2603.07080","last_updated":"2026-04-29T05:35:06Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T07:30:35Z","title":"VLN-Cache: Enabling Token Caching for VLN Models with Visual/Semantic Dynamics Awareness","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:58.269817Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2603.07080"},"observation_digest":"sha256:4a24a114453b82378c9e6cf45a5a2b499531d89bf7421d10d66540d05dd28caa","observation_id":"9a86e709-e12f-4f98-b08b-8ebdb98f2a4a","resolution":{"observed_at":"2026-05-15T14:51:08.250364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-02T17:15:42.360530Z","title":"arXiv preprint arXiv:2412.04453 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.27577","last_updated":"2026-08-01T10:28:12Z","snapshot_observed_at":"2026-08-08T02:26:12.336195Z","submitted_at":"2026-03-29T08:34:05Z","title":"Structured Observation Language for Efficient and Generalizable Vision-Language Navigation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T17:15:42.360530Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2603.27577"},"observation_digest":"sha256:39238c53cf44df96d07b3973b5748b38d33407115018939e843ca556427cfc7f","observation_id":"5db8e094-517c-4759-b35a-d9a0eb429c3d","resolution":{"observed_at":"2026-08-02T17:15:42.360530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-04T05:43:08.245773Z","title":"arXiv preprint arXiv:2412.04453 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.27577","last_updated":"2026-08-01T10:28:12Z","snapshot_observed_at":"2026-08-08T02:26:12.336195Z","submitted_at":"2026-03-29T08:34:05Z","title":"Structured Observation Language for Efficient and Generalizable Vision-Language Navigation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T05:43:08.245773Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2603.27577"},"observation_digest":"sha256:9afd15ab5a1ebb9fdf067005946557fa1e15a912d95a5e0bfac2b3c23fbcdf2a","observation_id":"b22d2ba4-de02-411a-9a1c-08d2a5beb5fc","resolution":{"observed_at":"2026-08-04T05:43:08.245773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2604.02911","last_updated":"2026-04-03T09:27:36Z","snapshot_observed_at":"2026-07-06T22:52:10.923214Z","submitted_at":"2026-04-03T09:27:36Z","title":"Learning Task-Invariant Properties via Dreamer: Enabling Efficient Policy Transfer for Quadruped Robots","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T19:49:23.086498Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2604.02911"},"observation_digest":"sha256:6cba604630b0d646da3f6ffd2335461fc9029deb59309b03532369a89221f68e","observation_id":"68842129-da80-4f90-be5e-25b2877a6721","resolution":{"observed_at":"2026-05-13T19:53:11.811580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2604.08232","last_updated":"2026-04-09T13:22:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T13:22:24Z","title":"HiRO-Nav: Hybrid ReasOning Enables Efficient Embodied Navigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T17:01:13.350219Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2604.08232"},"observation_digest":"sha256:e6f85116bc1b3a01357334973b2f6897c464c2eba11df572143fd1c985f5d4ec","observation_id":"36db350c-d7f4-4364-9154-3106a2bf5bec","resolution":{"observed_at":"2026-05-11T07:41:01.469951Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2604.08509","last_updated":"2026-04-09T17:50:09Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:50:09Z","title":"Visually-grounded Humanoid Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T18:10:32.710853Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2604.08509"},"observation_digest":"sha256:2fe33028c0b3bc1715d460d7ad235bd2d50ca4c51932b26547acc1234e291ab6","observation_id":"a483cbf6-61b7-4079-acc5-4094ee500782","resolution":{"observed_at":"2026-05-11T05:21:04.468428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2604.13654","last_updated":"2026-04-15T09:20:02Z","snapshot_observed_at":"2026-07-06T23:01:37.207817Z","submitted_at":"2026-04-15T09:20:02Z","title":"Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-10T13:48:08.135538Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2604.13654"},"observation_digest":"sha256:267b833ec5ab3aa02b92aa4f626c9aadb11a4305e45707532255ad488c535da5","observation_id":"f7431370-e85e-42e1-8961-779024c897df","resolution":{"observed_at":"2026-05-10T14:10:29.674502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2604.14344","last_updated":"2026-06-01T03:33:09Z","snapshot_observed_at":"2026-08-02T20:11:36.077756Z","submitted_at":"2026-04-15T18:52:50Z","title":"CART: Context-Aware Terrain Adaptation using Temporal Sequence Selection for Legged Robots","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T12:51:40.003948Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2604.14344"},"observation_digest":"sha256:ccbb0cf34caaa06d7a313147644fb5783f512381be04cf6c06e4fb4bd0fdd614","observation_id":"7b9d5fbe-234e-48c0-9b58-099b5820b2bb","resolution":{"observed_at":"2026-05-10T12:55:25.378958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-12T20:22:05.957224Z","title":"arXiv preprint arXiv:2412.04453 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.14344","last_updated":"2026-06-01T03:33:09Z","snapshot_observed_at":"2026-08-02T20:11:36.077756Z","submitted_at":"2026-04-15T18:52:50Z","title":"CART: Context-Aware Terrain Adaptation using Temporal Sequence Selection for Legged Robots","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T20:22:05.957224Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2604.14344"},"observation_digest":"sha256:cd1725f25144f4a42040366148a9f8b06080658b143c64a9083257888c6e9d70","observation_id":"6266283e-8f1e-4979-9cb4-72232016f271","resolution":{"observed_at":"2026-07-12T20:22:05.957224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2604.17407","last_updated":"2026-04-19T12:30:22Z","snapshot_observed_at":"2026-08-02T21:38:53.966924Z","submitted_at":"2026-04-19T12:30:22Z","title":"Think before Go: Hierarchical Reasoning for Image-goal Navigation","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-10T05:43:27.972164Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2604.17407"},"observation_digest":"sha256:d92fbd4b7c5b8571d8e2134035b3f08dafd7f01d70ce6f2dded4ae8d8289bd5f","observation_id":"84d45e28-7c51-45f1-8658-aac6ce8e678d","resolution":{"observed_at":"2026-05-10T05:51:10.522123Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2604.17473","last_updated":"2026-06-23T08:05:53Z","snapshot_observed_at":"2026-08-01T16:55:52.786011Z","submitted_at":"2026-04-19T15:03:38Z","title":"Dual-Anchoring: Addressing State Drift in Vision-Language Navigation","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-10T06:50:34.310831Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2604.17473"},"observation_digest":"sha256:dec5b3cd0aaee3e0e4df675eebba42d01d96442a265af16eef0fc98e5b1c044a","observation_id":"fe194dbe-af9d-46ea-968b-9dbfa45f548c","resolution":{"observed_at":"2026-05-10T06:51:45.831019Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2604.27620","last_updated":"2026-04-30T09:09:40Z","snapshot_observed_at":"2026-08-02T10:15:35.110642Z","submitted_at":"2026-04-30T09:09:40Z","title":"SpaAct: Spatially-Activated Transition Learning with Curriculum Adaptation for Vision-Language Navigation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-07T05:05:33.606975Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2604.27620"},"observation_digest":"sha256:46d3676fac26f761826c163028a0447023d2b2ce59414e4626854241e5353eed","observation_id":"163b26c4-4daa-4f7b-950c-d0651a2e70c7","resolution":{"observed_at":"2026-05-12T10:36:31.261652Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2605.09441","last_updated":"2026-05-10T09:34:05Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T09:34:05Z","title":"Beyond Isolation: A Unified Benchmark for General-Purpose Navigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T04:33:53.557357Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2605.09441"},"observation_digest":"sha256:64c858669cd9ae16b42fdbec345600a1201262cb8638dd931b4b7d0d0ed55d0f","observation_id":"388dea21-e8b9-4e71-8a59-2c428a5b97e3","resolution":{"observed_at":"2026-05-12T06:06:27.549019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2605.15517","last_updated":"2026-05-15T01:27:50Z","snapshot_observed_at":"2026-07-06T23:26:46.595393Z","submitted_at":"2026-05-15T01:27:50Z","title":"Terrain Consistent Reference-Guided RL for Humanoid Navigation Autonomy","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T15:22:38.188537Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2605.15517"},"observation_digest":"sha256:afa90f9438c858ae40f1054e16d99edda1ab00af708ad0d2308c3022759d0837","observation_id":"b01388b8-e8c8-4d07-b0bd-accfe5ee30ea","resolution":{"observed_at":"2026-05-19T15:23:07.747403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2605.17249","last_updated":"2026-06-04T15:16:16Z","snapshot_observed_at":"2026-08-02T18:37:17.554035Z","submitted_at":"2026-05-17T04:12:56Z","title":"SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T13:31:16.012419Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2605.17249"},"observation_digest":"sha256:63d4e232075c1b2be362a54c7632d998bbc38292699a5dc3a8323991b008f5d5","observation_id":"55735769-cfc8-49e1-91ae-76d4454c88e3","resolution":{"observed_at":"2026-05-20T13:33:19.148446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2605.17249","last_updated":"2026-06-04T15:16:16Z","snapshot_observed_at":"2026-08-02T18:37:17.554035Z","submitted_at":"2026-05-17T04:12:56Z","title":"SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T19:42:41.238072Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2605.17249"},"observation_digest":"sha256:e3cc697b7988ecb25be57d24471cf29f37d9ebb4b767c68b618e7dde8368b11a","observation_id":"84154134-46ff-4693-a428-37c25129d403","resolution":{"observed_at":"2026-06-30T19:45:00.664705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2605.22036","last_updated":"2026-05-21T06:20:17Z","snapshot_observed_at":"2026-08-03T01:34:12.134807Z","submitted_at":"2026-05-21T06:20:17Z","title":"GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T06:45:35.920991Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2605.22036"},"observation_digest":"sha256:8945b4f9cc93a0195be8db84f5c67b9485bbedd149191dbd86e0e37a1f6d4fcf","observation_id":"20405ac0-091c-4448-8806-d39c7ef3aef3","resolution":{"observed_at":"2026-05-22T06:46:10.584337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2605.22816","last_updated":"2026-05-21T17:58:26Z","snapshot_observed_at":"2026-08-03T04:05:29.788502Z","submitted_at":"2026-05-21T17:58:26Z","title":"AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T04:46:03.020800Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2605.22816"},"observation_digest":"sha256:2cf32c28cea285b31feff985513c9dbac3e463ff1c6d13928b22ab845e5ef391","observation_id":"2120b067-32a6-4a06-8585-b872eaeb6435","resolution":{"observed_at":"2026-05-22T04:46:04.562531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2605.25646","last_updated":"2026-05-25T09:52:58Z","snapshot_observed_at":"2026-08-03T00:04:56.361790Z","submitted_at":"2026-05-25T09:52:58Z","title":"G-DRAGON: Geospatial Reasoning and Dynamic Planning for Retrieval-Augmented Outdoor Navigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T21:49:54.950611Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2605.25646"},"observation_digest":"sha256:f19e3f606044262c028ca55bf039edf02f9fcf66e657cc6f54e04769a0aa9d94","observation_id":"deadbe25-e701-4ce6-8412-8e2732944916","resolution":{"observed_at":"2026-06-29T21:53:59.368576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2605.27582","last_updated":"2026-05-26T18:52:04Z","snapshot_observed_at":"2026-07-06T23:37:16.981482Z","submitted_at":"2026-05-26T18:52:04Z","title":"Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T17:01:20.073666Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2605.27582"},"observation_digest":"sha256:7b341a32dee4a84d4e8766f34c69202378a14c1223e57ad329268a335b84ca43","observation_id":"0ad83405-314b-48d1-861d-db91b4970d60","resolution":{"observed_at":"2026-06-29T17:03:40.848584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2605.28237","last_updated":"2026-05-27T09:50:16Z","snapshot_observed_at":"2026-08-06T23:55:29.770936Z","submitted_at":"2026-05-27T09:50:16Z","title":"POINav: Benchmarking and Enhancing Final-Meters Arrival in Real-World Vision-Language Navigation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T11:48:14.888295Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2605.28237"},"observation_digest":"sha256:1289e0adafe93e78beb3c49cb21eba9cac4e2d7ce9c8734577420d237fbcebde","observation_id":"7d8c41c4-e31e-4da3-bf8b-14aaa25f3361","resolution":{"observed_at":"2026-06-29T11:53:23.916822Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.00104","last_updated":"2026-05-26T10:03:22Z","snapshot_observed_at":"2026-07-06T23:40:51.363776Z","submitted_at":"2026-05-26T10:03:22Z","title":"PEACE: A Planner-Executor Agent with Constraint Enforcement for UAVs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T16:53:17.504094Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.00104"},"observation_digest":"sha256:6e8c798a8b47f052a1706da7dcf4a643c4b9619de5ea2564fd77fbf8823560cb","observation_id":"1e1a8380-b7ab-4042-b09e-9aeb5418ec3e","resolution":{"observed_at":"2026-06-29T16:53:40.418154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.01565","last_updated":"2026-06-01T02:11:01Z","snapshot_observed_at":"2026-08-03T01:21:10.016700Z","submitted_at":"2026-06-01T02:11:01Z","title":"Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T14:49:30.585724Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.01565"},"observation_digest":"sha256:c43642987ef338e3aa1a33014f7981873f1fc120ae435b4ec0d0319794403477","observation_id":"2bd71fac-4c4b-4551-9a56-6e6f7fdb41bb","resolution":{"observed_at":"2026-07-01T22:56:20.934190Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:24328a1d762753483ca0d62a67676dcfd67b7b762fb6855f1f2e9e242b3f76cf","observation_id":"b79fac24-9072-4f62-8a59-08199f454518","resolution":{"observed_at":"2026-07-01T22:16:15.795177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.03175","last_updated":"2026-06-03T03:34:51Z","snapshot_observed_at":"2026-08-06T03:40:21.903218Z","submitted_at":"2026-06-02T05:31:03Z","title":"Ask When It Pays: Cost-Aware Open-Ended Interaction for Instance Goal Navigation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T11:01:08.668612Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.03175"},"observation_digest":"sha256:1b86a79427de8b1f6a4b3c3876cdaa1ed2b109f504394a24604ca5fde965c493","observation_id":"c09ffcf2-259f-4859-bf6e-bc2d6c216df2","resolution":{"observed_at":"2026-07-02T02:26:26.123860Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.07244","last_updated":"2026-06-05T13:11:39Z","snapshot_observed_at":"2026-08-03T01:43:22.064081Z","submitted_at":"2026-06-05T13:11:39Z","title":"Beyond Waypoints: A Trajectory-Centric Waypointing Paradigm for Vision-Language Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T21:40:58.329546Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.07244"},"observation_digest":"sha256:e022d70a794a188affb0f067364c612fd55aca874ae9bad2b84713ab1f8a9e64","observation_id":"d7115002-5b6a-4bdb-83f5-cbf262b684e5","resolution":{"observed_at":"2026-07-02T19:07:17.750835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.10495","last_updated":"2026-06-09T07:18:01Z","snapshot_observed_at":"2026-08-02T10:00:24.356645Z","submitted_at":"2026-06-09T07:18:01Z","title":"Act on What You See: Unlocking Safe Social Navigation in Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T12:52:38.764427Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.10495"},"observation_digest":"sha256:d9500621d79636dbc391e4b141272a8d7269317844d60fcaae22cc205350f446","observation_id":"17ad59cb-7c8d-4d41-9b1f-2347ee9a9ca5","resolution":{"observed_at":"2026-07-03T06:07:41.671095Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.12603","last_updated":"2026-06-10T19:01:31Z","snapshot_observed_at":"2026-08-07T13:05:45.178504Z","submitted_at":"2026-06-10T19:01:31Z","title":"From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T09:29:43.030058Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.12603"},"observation_digest":"sha256:5a65f0b53cc04ce4380e9f76321c9e5d1b5290a6672edd71bb688b1b5d08c149","observation_id":"8eabb674-170a-4a53-8da8-8543c03f3941","resolution":{"observed_at":"2026-07-03T11:38:04.652491Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.18426","last_updated":"2026-07-29T15:48:23Z","snapshot_observed_at":"2026-08-02T11:03:48.878962Z","submitted_at":"2026-06-16T19:21:14Z","title":"VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T00:15:26.619238Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.18426"},"observation_digest":"sha256:6232c7048d117eb26ee607e0ba7bfdfedcbe67642ebbbee66570fa006b21d36a","observation_id":"899df63f-9ade-4e5b-85f9-6121d359961f","resolution":{"observed_at":"2026-07-03T21:38:59.469725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-02T11:03:51.561853Z","title":"Cheng, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18426","last_updated":"2026-07-29T15:48:23Z","snapshot_observed_at":"2026-08-02T11:03:48.878962Z","submitted_at":"2026-06-16T19:21:14Z","title":"VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T11:03:51.561853Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.18426"},"observation_digest":"sha256:6018e5c0c7192d2f03c954cabb90e5e41cb664129688aec43c6968db3b7514b4","observation_id":"cbada972-9842-43c1-b840-9bb5f6f2b4bc","resolution":{"observed_at":"2026-08-02T11:03:51.561853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.20458","last_updated":"2026-06-18T16:40:07Z","snapshot_observed_at":"2026-08-07T03:20:01.050993Z","submitted_at":"2026-06-18T16:40:07Z","title":"Slow Brain, Fast Planner: Latency-Resilient VLM-Augmented Urban Navigation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T17:16:52.173943Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.20458"},"observation_digest":"sha256:93e0207d1943a88362f000e79983994b86a270182381fe7288fed8aae279d777","observation_id":"8ccd85cd-0fa4-4d8d-9ba3-6250c061aa6c","resolution":{"observed_at":"2026-07-04T04:09:33.984552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.20905","last_updated":"2026-06-18T20:01:32Z","snapshot_observed_at":"2026-08-03T03:13:19.923134Z","submitted_at":"2026-06-18T20:01:32Z","title":"Vesta: A Generalist Embodied Reasoning Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T16:55:12.518255Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.20905"},"observation_digest":"sha256:5a50e601b8e2a12e2c4aed54688a55b18075126dcf8318cc1b24368c54d06f9c","observation_id":"091a2de6-e56a-4a62-a619-e2b06ba794e9","resolution":{"observed_at":"2026-07-04T04:29:35.757784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.21398","last_updated":"2026-06-19T13:06:02Z","snapshot_observed_at":"2026-08-04T00:30:09.459045Z","submitted_at":"2026-06-19T13:06:02Z","title":"BIT-Nav: Brain-Inspired Trajectory Memory for Embodied Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T13:52:31.453516Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.21398"},"observation_digest":"sha256:eeddfda266a5bcf67ea92ea183a88d9be0ff0ea59583659f4fa515c28b3b21fc","observation_id":"38150bff-1b9d-4291-993b-8050aec8de85","resolution":{"observed_at":"2026-07-04T07:09:37.370731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.22424","last_updated":"2026-06-23T03:11:10Z","snapshot_observed_at":"2026-08-06T19:03:46.948100Z","submitted_at":"2026-06-21T10:24:16Z","title":"FlowDec: Temporal Conditional Flow Decorruptor for Robust Continuous Vision-Language Navigation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T10:24:56.607921Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.22424"},"observation_digest":"sha256:e5a3a65ebb264cf150312f0770a867c764c2bfcac1cca6ec50065a651e0cb8f6","observation_id":"6f8c30ea-56fe-49c7-8600-cc3687652cac","resolution":{"observed_at":"2026-07-04T09:09:43.512947Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.27807","last_updated":"2026-06-26T07:45:45Z","snapshot_observed_at":"2026-07-07T00:01:59.695342Z","submitted_at":"2026-06-26T07:45:45Z","title":"SpikeVLA: Vision-Language-Action Models with Spiking Neural Networks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T04:42:23.040915Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.27807"},"observation_digest":"sha256:558c8921ce54fcfacaca519db03cbca96b3211393d0d6652500f86a03b105987","observation_id":"c560a56e-eacc-4fe8-a460-cefc703ba6df","resolution":{"observed_at":"2026-06-29T19:33:54.613197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.28760","last_updated":"2026-06-27T06:32:47Z","snapshot_observed_at":"2026-08-02T05:23:21.716610Z","submitted_at":"2026-06-27T06:32:47Z","title":"Vision-Language Models for Deployable Social Robot Navigation: Bridging Semantic Reasoning and Low-Level Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T09:52:51.549135Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.28760"},"observation_digest":"sha256:8d90159ee1456f03511656e8ea75594c19990dff8aef433b771c7669ecccefe8","observation_id":"613b6a72-ca78-421f-b77f-9dec93d39f73","resolution":{"observed_at":"2026-06-30T09:54:34.519791Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2606.30367","last_updated":"2026-06-29T14:33:03Z","snapshot_observed_at":"2026-08-06T15:33:36.109677Z","submitted_at":"2026-06-29T14:33:03Z","title":"FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T05:05:56.065261Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2606.30367"},"observation_digest":"sha256:425bd47a8415c9795e2651f91cc5ce288aeb3af17854094fb6920884dd216ad4","observation_id":"73fef3cb-f37c-4a72-9c36-98d11587368b","resolution":{"observed_at":"2026-06-30T15:54:49.928777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2607.01754","last_updated":"2026-07-02T06:11:07Z","snapshot_observed_at":"2026-08-02T15:41:12.241586Z","submitted_at":"2026-07-02T06:11:07Z","title":"Path-level Hindsight Instructions for Semantic Exploration in Vision-Language Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-03T14:04:46.400336Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.01754"},"observation_digest":"sha256:232dcbe089f4b8fb8d3dfa0ffc90296e8e54a776e5480c7a709b2ea7d1c6fa7c","observation_id":"c132e310-40d5-4fa2-92b5-e7a178b3f5ab","resolution":{"observed_at":"2026-07-03T14:08:21.406594Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-12T04:33:48.376442Z","title":"Navila: Legged robot vision-language- action model for navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03146","last_updated":"2026-07-03T09:37:48Z","snapshot_observed_at":"2026-08-07T22:45:11.565424Z","submitted_at":"2026-07-03T09:37:48Z","title":"Exp2VLA: Enabling Vision-Language-Action for Drone Navigation from Expert Demonstrations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T04:33:48.376442Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.03146"},"observation_digest":"sha256:28ff18b34806e915d21fb8b89a7504541ef43d11579a09f99883e91af685f28e","observation_id":"a3f816f0-a771-4f4e-9e6b-66e40e2249b1","resolution":{"observed_at":"2026-07-12T04:33:48.376442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Navila: Legged robot vision-language-action model for navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:792c9020ee6a18c10e7607f65948173b015480a4d5473aa85689b414b2ee3dae","observation_id":"60e3694c-c7e2-4522-8943-3ba9f774cccf","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-07T21:59:33.598399Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:56b165b16f46474035e8698d69f7d146bcbfb8233cff2e554e60788837b3b138","observation_id":"b6e50527-e702-4417-aa23-4552559563ad","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-01T16:20:01.293615Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18042","last_updated":"2026-07-23T15:59:17Z","snapshot_observed_at":"2026-08-07T04:23:36.775322Z","submitted_at":"2026-07-20T15:11:46Z","title":"Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-01T16:20:01.293615Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.18042"},"observation_digest":"sha256:5d451da533394bb8fda6f38fed6b186390911213d9aac580a9157a1f5edc8331","observation_id":"f4729f4d-613e-4a48-bbbf-f24dfdff1b23","resolution":{"observed_at":"2026-08-01T16:20:01.293615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-01T11:30:22.146055Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19880","last_updated":"2026-08-05T18:04:48Z","snapshot_observed_at":"2026-08-08T21:13:48.016901Z","submitted_at":"2026-07-22T08:10:49Z","title":"EA-Nav: Learning Safe Visual Navigation Policies with Embodiment Awareness","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T11:30:22.146055Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.19880"},"observation_digest":"sha256:b5c7d7220b9ac2cad329035366f2401d5c123572028676abc0bd9c21d9ac7199","observation_id":"4dcd7d93-6b4e-406e-a652-5bedd565ddcb","resolution":{"observed_at":"2026-08-01T11:30:22.146055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-01T06:17:39.791761Z","title":"De Heuvel J, Corral N, Kreis B, Conradi J, Driemel A and Bennewitz M (2023) Learning depth vision-based personalized robot navigation from dynamic demonstrations in virtual reality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21964","last_updated":"2026-07-24T04:23:21Z","snapshot_observed_at":"2026-08-05T16:26:12.692120Z","submitted_at":"2026-07-24T04:23:21Z","title":"ACME: A Multi-Cultural, Multi-Embodiment Social-Navigation Dataset","version":1},"reference_index":292,"source":"pdf_text","source_observed_at":"2026-08-01T06:17:39.791761Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.21964"},"observation_digest":"sha256:e468ed1fbcc6c0f8614d8090e32ad470e935af5f74e1c423390bcfcfb68b7ae8","observation_id":"7e252989-0e19-47ea-a185-1296bbc615d6","resolution":{"observed_at":"2026-08-01T06:17:39.791761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-01T06:06:22.870692Z","title":"Navila: Legged robot vision-language-action model for navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22014","last_updated":"2026-07-24T06:22:50Z","snapshot_observed_at":"2026-08-07T06:57:58.643202Z","submitted_at":"2026-07-24T06:22:50Z","title":"Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T06:06:22.870692Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.22014"},"observation_digest":"sha256:21e31783cc43abe10ad8e8fa22600b1ba3b7ced259e055e1eb81dc4091302697","observation_id":"79160368-0112-47d0-b764-c75123e98fe3","resolution":{"observed_at":"2026-08-01T06:06:22.870692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-30T20:42:03.068111Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:03.068111Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:9551a3b0b28e873927ee78f7f81a2a360f58d9284b68c1680af11bf0d87c611d","observation_id":"51a0af7a-2ead-4729-b06b-9357ef1cda00","resolution":{"observed_at":"2026-07-30T20:42:03.068111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-01T00:43:30.833308Z","title":"Cheng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26148","last_updated":"2026-08-03T01:02:45Z","snapshot_observed_at":"2026-08-06T23:24:51.965436Z","submitted_at":"2026-07-28T18:00:34Z","title":"Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T00:43:30.833308Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.26148"},"observation_digest":"sha256:808d76d99584ef8ec8ab6a9e679901960dd63e237e84fd7955f6d0faa6f729a5","observation_id":"fda33824-fdbd-4099-8d6b-0184621082ef","resolution":{"observed_at":"2026-08-01T00:43:30.833308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-04T03:24:27.168988Z","title":"Cheng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26148","last_updated":"2026-08-03T01:02:45Z","snapshot_observed_at":"2026-08-06T23:24:51.965436Z","submitted_at":"2026-07-28T18:00:34Z","title":"Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T03:24:27.168988Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.26148"},"observation_digest":"sha256:41fb7a3b0913f616629c47ac7a8a2488a03f612bb190db4dfac6becb89ecdf5e","observation_id":"b0ffe209-0598-4085-a7b1-ca7ea417fa2f","resolution":{"observed_at":"2026-08-04T03:24:27.168988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.04453/citation-record","integrity":"/paper/2412.04453/integrity","json":"/paper/2412.04453/citation-record.json","paper":"/paper/2412.04453"},"outbound":[],"paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 76 inbound Pith citation observations for arXiv:2412.04453."}