{"as_of":"2026-08-19T15:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac86ef080f6b098101ee23f6209e0165cbd383e054027c1afc494c142bc40197","coverage":[{"denominator":111,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:52:13.187878Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:33:52.124767Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T15:08:02.004021Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20897","snapshot_observed_at":"2026-08-07T13:33:52.124767Z","title":"Cross from left to right brain: Adaptive text dreamer for vision-and-language navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-16T20:20:00.967462Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:33:52.124767Z"},"links":{"cited_paper":"/paper/2505.20897","citing_paper":"/paper/2505.21432"},"observation_digest":"sha256:087ce2d8b954d1de25a9eaf9ee576e38897ece0f67bdbb45cdb1987f89a30348","observation_id":"232a0add-3c70-40f2-85a8-dc5ba1c1ae8a","resolution":{"observed_at":"2026-08-07T13:33:52.124767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":"2505.20897","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20897","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross from left to right brain: Adaptive text dreamer for vision-and-language navigation","venue":null,"work_id":"6d6f9796-a120-4d1f-bd1b-e56bc4e5ef5e","year":2025},"citing_paper":{"arxiv_id":"2601.07060","last_updated":"2026-04-04T05:08:38Z","snapshot_observed_at":"2026-08-11T15:47:37.451369Z","submitted_at":"2026-01-11T21:00:58Z","title":"PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation","version":2},"reference_index":145,"source":"pdf_text","source_observed_at":"2026-05-16T15:05:21.907878Z"},"links":{"cited_paper":"/paper/2505.20897","citing_paper":"/paper/2601.07060"},"observation_digest":"sha256:af9d0baf8a0e4aae377549ca23881133dcf3e250bc8314bfb5986b8db1765ee6","observation_id":"ba35fdea-15f9-4d89-9d38-3bfa8709e371","resolution":{"observed_at":"2026-05-16T15:08:02.005963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":"2505.20897","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20897","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross from left to right brain: Adaptive text dreamer for vision-and-language navigation","venue":null,"work_id":"6d6f9796-a120-4d1f-bd1b-e56bc4e5ef5e","year":2025},"citing_paper":{"arxiv_id":"2603.13842","last_updated":"2026-04-10T02:57:29Z","snapshot_observed_at":"2026-08-02T22:21:29.644302Z","submitted_at":"2026-03-14T08:53:47Z","title":"Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T11:56:40.836234Z"},"links":{"cited_paper":"/paper/2505.20897","citing_paper":"/paper/2603.13842"},"observation_digest":"sha256:14014482629571e23aed6360614cd1713e4d0d9e06b51fb2a9042856c0f85ced","observation_id":"afb3dd88-7706-460a-8276-049262e9fbd5","resolution":{"observed_at":"2026-05-15T11:59:59.485439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":"2505.20897","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20897","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross from left to right brain: Adaptive text dreamer for vision-and-language navigation","venue":null,"work_id":"6d6f9796-a120-4d1f-bd1b-e56bc4e5ef5e","year":2025},"citing_paper":{"arxiv_id":"2604.17982","last_updated":"2026-04-20T09:04:49Z","snapshot_observed_at":"2026-08-12T18:21:47.619082Z","submitted_at":"2026-04-20T09:04:49Z","title":"Mitigating Multimodal Hallucination via Phase-wise Self-reward","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T05:10:45.144421Z"},"links":{"cited_paper":"/paper/2505.20897","citing_paper":"/paper/2604.17982"},"observation_digest":"sha256:65b7823131d060ac9cb7cc4e026dc2f6d092cb7de5d10470f9aeed8b144049f3","observation_id":"12ba7cec-1e9f-4289-a725-4b0257a6d9b4","resolution":{"observed_at":"2026-05-10T09:38:43.261922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20897","snapshot_observed_at":"2026-08-01T03:26:13.213780Z","title":"Cross from left to right brain: Adaptive text dreamer for vision-and-language navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-17T19:58:31.029066Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:13.213780Z"},"links":{"cited_paper":"/paper/2505.20897","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:4af4990ff07abe34986a93d77e5b3e3ab6f10cccf8b4f29ad05a2545811299f1","observation_id":"92eb84c2-2bcd-48d2-b0b0-7014200d7bd7","resolution":{"observed_at":"2026-08-01T03:26:13.213780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20897/citation-record","integrity":"/paper/2505.20897/integrity","json":"/paper/2505.20897/citation-record.json","paper":"/paper/2505.20897"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:52:03.729011Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:03.729011Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:1ffa62b4dca4ee3857b8958163c4ad60185a72ac6dd71d05435b5de11304cac6","observation_id":"42b28ae1-e824-4ded-b535-ee8046d7830e","resolution":{"observed_at":"2026-08-07T13:52:03.729011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04385","last_updated":"2023-08-03T09:39:00Z","snapshot_observed_at":"2026-08-16T16:10:00.769704Z","submitted_at":"2022-12-08T16:27:54Z","title":"BEVBert: Multimodal Map Pre-training for Language-guided Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04385","snapshot_observed_at":"2026-08-07T13:52:03.792370Z","title":"Bevbert: Multimodal map pre-training for language-guided navigation.arXiv preprint arXiv:2212.04385, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:03.792370Z"},"links":{"cited_paper":"/paper/2212.04385","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:b85c3b27197db03376f5a6ec3501d0ab547adc88933ab6fe048745e6bcb492e2","observation_id":"8515c56d-e73d-4b7b-be09-c17388a5d911","resolution":{"observed_at":"2026-08-07T13:52:03.792370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.06757","last_updated":"2018-07-18T03:28:02Z","snapshot_observed_at":"2026-08-14T11:12:04.949259Z","submitted_at":"2018-07-18T03:28:02Z","title":"On Evaluation of Embodied Navigation Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.06757","snapshot_observed_at":"2026-08-07T13:52:03.875356Z","title":"On evaluation of embodied navigation agents.arXiv preprint arXiv:1807.06757, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:03.875356Z"},"links":{"cited_paper":"/paper/1807.06757","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:084ee7171464d432624b3a09b3e82308f38a77875afef82e13f5e3bfe7c3011d","observation_id":"fd591820-3398-4ce1-a291-872e07908624","resolution":{"observed_at":"2026-08-07T13:52:03.875356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:03.963891Z","title":"Reid, Stephen Gould, and Anton van den Hengel","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:03.963891Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:d4b742097ec6d249abfd62ef7f511860383463280016fdc445e35636c7eda718","observation_id":"4a3329de-76f9-488d-8880-c80ef3b060ef","resolution":{"observed_at":"2026-08-07T13:52:03.963891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:52:04.042901Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:04.042901Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:28f7af89a106de8383cc101e3676a39021b2ed3a91bf7c62434ff2025627b505","observation_id":"62297a97-52db-4ff8-9a58-55d408e92584","resolution":{"observed_at":"2026-08-07T13:52:04.042901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03572","last_updated":"2025-04-11T19:20:22Z","snapshot_observed_at":"2026-08-16T19:44:01.189794Z","submitted_at":"2024-12-04T18:59:45Z","title":"Navigation World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03572","snapshot_observed_at":"2026-08-07T13:52:04.150019Z","title":"Navigation world models.arXiv preprint arXiv:2412.03572, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:04.150019Z"},"links":{"cited_paper":"/paper/2412.03572","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:9f93851d9de0174dd09846ae8ffb6068a314f36bdfb6b57b4dc442fdff280657","observation_id":"f445c548-e51c-4eab-91ca-ab830bdc91dd","resolution":{"observed_at":"2026-08-07T13:52:04.150019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:04.248205Z","title":"Mip-nerf: A multiscale representation for anti-aliasing neural radiance fields","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:04.248205Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:cf1da462511727247529cf288d0d5527db658183d84db179ce970d92866203c0","observation_id":"4fbca4ec-f484-4fa9-bdfc-fc307f47ec0d","resolution":{"observed_at":"2026-08-07T13:52:04.248205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:04.311176Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:04.311176Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:b7fbb16b6a12ee1f6402e9084021e867dd9cb7f6713747b411b9fd69fc191f13","observation_id":"4ef9b54b-dbc3-4734-8c18-f419a8acfe2b","resolution":{"observed_at":"2026-08-07T13:52:04.311176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-16T04:42:52.370966Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-07T13:52:04.390878Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems.arXiv preprint arXiv:2503.06669, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:04.390878Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:583bf1a9862f139822566c3f763ad20e32e79f8910b03f4e5471ae4d038f845a","observation_id":"5a3e4665-213c-4739-b995-590c2fedc636","resolution":{"observed_at":"2026-08-07T13:52:04.390878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04006","last_updated":"2024-11-06T15:44:59Z","snapshot_observed_at":"2026-08-16T13:02:23.703343Z","submitted_at":"2024-11-06T15:44:59Z","title":"Select2Plan: Training-Free ICL-Based Planning through VQA and Memory Retrieval","version":1},"cited_work":{"arxiv_id":"2411.04006","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04006","snapshot_observed_at":"2026-08-07T13:52:15.580604Z","title":"Select2Plan: Training-Free ICL-Based Planning through VQA and Memory Retrieval","venue":"cs.RO","work_id":"1dc16046-2c1c-4548-b8a8-85da55370c3a","year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:04.455666Z"},"links":{"cited_paper":"/paper/2411.04006","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:22e64cbbd69e91b2f4920a99c46867246b16f14934fd192d261f05153aa4a243","observation_id":"c792e877-07bb-421e-aa4f-a266d4e8da0a","resolution":{"observed_at":"2026-08-07T13:52:15.640515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:04.529841Z","title":"pixelsplat: 3d gaussian splats from image pairs for scalable generalizable 3d reconstruction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:04.529841Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:417781138ad31d9f56fa05c626d5b95c037e3c88ad272c8c233ca51492c2b7d9","observation_id":"3be40f70-2029-4333-a4a8-75e99bbe0a0a","resolution":{"observed_at":"2026-08-07T13:52:04.529841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:04.614330Z","title":"Touchdown: Natural language navigation and spatial reasoning in visual street environments","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:04.614330Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:f5d6cc4c8e6ce2b583364c051d38c884216710f493e34862172dd44219a300f6","observation_id":"2129020f-97a7-44c2-ba92-0ec78753c39f","resolution":{"observed_at":"2026-08-07T13:52:04.614330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:04.673884Z","title":"Affordances- oriented planning using foundation models for continuous vision-language navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:04.673884Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:c3ce0a7e2ca00094a2154658d23aacf6cf337d77f682ae905889d539f98f2f39","observation_id":"917fa3f1-0d29-405f-83a0-4a166525a493","resolution":{"observed_at":"2026-08-07T13:52:04.673884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:04.739175Z","title":"Mapgpt: Map-guided prompting for unified vision-and-language navigation.arXiv e-prints, pages arXiv–2401,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:04.739175Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:e9487a1fb9520e67f5e2d22e47f7335409926772eed86c169b50e02ad2ba6278","observation_id":"9f0d692f-ac84-4e45-b223-9cf3299d5064","resolution":{"observed_at":"2026-08-07T13:52:04.739175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10137","last_updated":"2025-04-15T02:20:35Z","snapshot_observed_at":"2026-08-15T01:58:30.067821Z","submitted_at":"2024-12-13T13:38:41Z","title":"Constraint-Aware Zero-Shot Vision-Language Navigation in Continuous Environments","version":4},"cited_work":{"arxiv_id":"2412.10137","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10137","snapshot_observed_at":"2026-08-07T13:52:15.400669Z","title":"Constraint-Aware Zero-Shot Vision-Language Navigation in Continuous Environments","venue":"cs.RO","work_id":"679ccf56-44c8-4ec3-b217-1650513be1c2","year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:04.806979Z"},"links":{"cited_paper":"/paper/2412.10137","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:95b8b29b9bcdc35d85d644b327990ff4faf861be6d4f8c37e7e73fdfa2dd77c4","observation_id":"f707e771-3663-4f84-a363-d51d6ecab7fc","resolution":{"observed_at":"2026-08-07T13:52:15.496671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07997","last_updated":"2023-08-15T19:01:19Z","snapshot_observed_at":"2026-08-18T09:11:51.936392Z","submitted_at":"2023-08-15T19:01:19Z","title":"$A^2$Nav: Action-Aware Zero-Shot Robot Navigation by Exploiting Vision-and-Language Ability of Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07997","snapshot_observed_at":"2026-08-07T13:52:04.892845Z","title":"a2 nav: Action-aware zero-shot robot navigation by exploiting vision-and-language ability of foundation models.arXiv preprint arXiv:2308.07997, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:04.892845Z"},"links":{"cited_paper":"/paper/2308.07997","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:0b6f2cc055a5d11acc3963d46be20d1cf9eb84bca437f219b3fbb504d77a011f","observation_id":"a354b9cd-0b2f-4b18-80ab-d78d4c53e4a9","resolution":{"observed_at":"2026-08-07T13:52:04.892845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13309","last_updated":"2023-08-17T22:42:07Z","snapshot_observed_at":"2026-08-18T09:10:39.774722Z","submitted_at":"2021-10-25T22:54:41Z","title":"History Aware Multimodal Transformer for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13309","snapshot_observed_at":"2026-08-07T13:52:05.004076Z","title":"History aware multimodal trans- former for vision-and-language navigation.ArXiv, abs/2110.13309, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.004076Z"},"links":{"cited_paper":"/paper/2110.13309","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:c7c32dc60661084a317595ef8347162b23b5de925f56f699787517c6c61dff25","observation_id":"0847f6cc-088e-44bf-9095-b2189aa3c309","resolution":{"observed_at":"2026-08-07T13:52:05.004076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:05.088751Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.088751Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:a863370101915a984e9dfce4865f430488e9a82c75dfa6fa8d659da142bc7ce2","observation_id":"34a1b7e9-8499-4795-86d9-2bce23bb62bd","resolution":{"observed_at":"2026-08-07T13:52:05.088751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:05.176658Z","title":"Mvsplat: Efficient 3d gaussian splatting from sparse multi-view images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.176658Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:d1dafa42838c890e006cab6bfad9aff25fc291b04326be8130dfa5b8d7e8d98d","observation_id":"8530d528-fac4-49ef-9ccc-7a87489d2b32","resolution":{"observed_at":"2026-08-07T13:52:05.176658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-17T17:58:31.496050Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T13:52:05.254189Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.254189Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:997e02dbe7834181cee8c9d41bf179ab25a9518917d9e4261a9c69648f3a0fc4","observation_id":"c73ab88c-39f1-44a1-b111-8abc20fdbeba","resolution":{"observed_at":"2026-08-07T13:52:05.254189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16053","last_updated":"2025-03-16T10:43:31Z","snapshot_observed_at":"2026-08-19T08:20:11.082654Z","submitted_at":"2024-11-25T02:44:59Z","title":"UnitedVLN: Generalizable Gaussian Splatting for Continuous Vision-Language Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16053","snapshot_observed_at":"2026-08-07T13:52:05.338243Z","title":"Unitedvln: Generalizable gaussian splatting for continuous vision-language navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.338243Z"},"links":{"cited_paper":"/paper/2411.16053","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:e60ae3d4f5a8d73703d88c39e8524a8b904fe1845187921b73593bc661bceb0e","observation_id":"792b3c4c-b1f5-4d6d-a1b5-cac32319bd0b","resolution":{"observed_at":"2026-08-07T13:52:05.338243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:05.421758Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.421758Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:5999fd7f9937150bfe30726cf992100dfed9d478200199726ffdd61929fd14b3","observation_id":"ccae74ca-9f49-423a-97bf-1ea3ac9fc62d","resolution":{"observed_at":"2026-08-07T13:52:05.421758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:05.528631Z","title":"Embodied question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.528631Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:1b438d4f367f007a97daa1ede8d69beae3e814be737e2b7dedfeda31430c292c","observation_id":"ccf8a4da-adf7-4d60-a3a8-1f3d6def2cf7","resolution":{"observed_at":"2026-08-07T13:52:05.528631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.05655","last_updated":"2020-07-11T00:21:05Z","snapshot_observed_at":"2026-08-14T14:36:54.803837Z","submitted_at":"2020-07-11T00:21:05Z","title":"Evolving Graphical Planner: Contextual Global Planning for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2007.05655","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.05655","snapshot_observed_at":"2026-08-07T13:52:15.191833Z","title":"Evolving Graphical Planner: Contextual Global Planning for Vision-and-Language Navigation","venue":"cs.CV","work_id":"13be035b-213c-42fd-aca4-d3de69d6f08e","year":2020},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.576568Z"},"links":{"cited_paper":"/paper/2007.05655","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:b2cf8ad040f9646e21108fac87ce7081e3f47ae1255e4f1d397a982629a6c1af","observation_id":"376ca1f0-9d77-4786-b136-c06724d0419b","resolution":{"observed_at":"2026-08-07T13:52:15.252256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:05.581336Z","title":"Navigation instruction generation with bev perception and large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.581336Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:2efae754e2ac50c5b9cbf33ac41092b14bb18194db34406594d9f295a7ada713","observation_id":"916b7495-8dff-4425-b94a-3c47a1c88816","resolution":{"observed_at":"2026-08-07T13:52:05.581336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12219","last_updated":"2023-06-01T06:39:11Z","snapshot_observed_at":"2026-08-16T16:58:00.050761Z","submitted_at":"2022-05-24T17:28:14Z","title":"Aerial Vision-and-Dialog Navigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12219","snapshot_observed_at":"2026-08-07T13:52:05.586738Z","title":"Aerial vision-and- dialog navigation.arXiv preprint arXiv:2205.12219, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.586738Z"},"links":{"cited_paper":"/paper/2205.12219","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:777cb46b6d77dc6de9712bdd38e4e3e9937e3ab6dd5aa34a6d36a0db03d2aa7a","observation_id":"1f49b58c-0b2f-4238-b8cd-b5ec8a33e990","resolution":{"observed_at":"2026-08-07T13:52:05.586738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:05.610588Z","title":"Speaker-follower models for vision-and-language navigation.Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.610588Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:34dbf97c08f0c3c7aebe679efec3f3ae73c9521472e92c03993b61b8cf0e17f2","observation_id":"a3ea4f6d-4243-41ca-b6be-73b1eb7e218a","resolution":{"observed_at":"2026-08-07T13:52:05.610588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:05.627822Z","title":"Room-and-object aware knowledge reasoning for remote embodied referring expression","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.627822Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:8b92935f582a33085fcb2536b28dd91212799c3a71c4e26bfab0cd05f621ea65","observation_id":"c02b0629-ee31-411d-ac4d-404b0080e864","resolution":{"observed_at":"2026-08-07T13:52:05.627822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:05.644391Z","title":"Airbert: In-domain pretraining for vision-and-language navigation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.644391Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:d48b201ca6f9fd8e91ed6a709a8747b4fa6c32ac4b0929d93e0cf0fb30bd77a3","observation_id":"a36d17cf-a648-441e-9e26-e1c73f2ee393","resolution":{"observed_at":"2026-08-07T13:52:05.644391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:05.664016Z","title":"Deep learning for real-time atari game play using offline monte-carlo tree search planning.Advances in neural information processing systems, 27, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.664016Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:5b40f914f95a5982de953457d24cbdb0130959df69b121557eb30fdf75e2b409","observation_id":"ab7f369d-e4b7-4acf-bf7c-82de42ae52f4","resolution":{"observed_at":"2026-08-07T13:52:05.664016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:05.733392Z","title":"Towards learning a generic agent for vision-and-language navigation via pre-training","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.733392Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:1cb99c4bbd763d9997d6372937217bdf54816e0120aadf831c3ccbd676a13694","observation_id":"8273e258-f889-4d8d-8cf2-6c5416a141db","resolution":{"observed_at":"2026-08-07T13:52:05.733392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:05.815968Z","title":"Vln bert: A recurrent vision-and-language bert for navigation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.815968Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:414aaee6b90e6e261cafb82dff2d9d70d9ca995237d9da5b6dbd0e4c8c21a6ff","observation_id":"a61f9ecf-dd84-44f3-9317-65302e609683","resolution":{"observed_at":"2026-08-07T13:52:05.815968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:05.882979Z","title":"Parameter-efficient transfer learning for nlp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.882979Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:0952d22e330e09ed5ec96009ddb4d214464d41ed201624b0653cabe2b6979483","observation_id":"7be12a0f-41da-463a-ab6d-9e3c1c701340","resolution":{"observed_at":"2026-08-07T13:52:05.882979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:05.958830Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.958830Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:f942384610500cd840aff24ebb9d6c4b1b7c40def9fdc1857a63b4d47a0b71e1","observation_id":"18c02c58-2514-44f1-b76a-39dd081ba764","resolution":{"observed_at":"2026-08-07T13:52:05.958830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-07T13:52:06.027960Z","title":"An embodied generalist agent in 3d world.arXiv preprint arXiv:2311.12871, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:06.027960Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:dc33eaefd19ae2bd77da1d7fff1e03ad6aca1d0621f9ba1231d88121283c9213","observation_id":"86a1f739-23ec-446e-a5b7-a3d6febcab3a","resolution":{"observed_at":"2026-08-07T13:52:06.027960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:06.115536Z","title":"Visual prompt tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:06.115536Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:88fbfc7638f26bc621bc467f98ef15ace419484a0213b5814e47b1080c2931c4","observation_id":"3ff63169-d16e-402d-b6b5-114d342bfb91","resolution":{"observed_at":"2026-08-07T13:52:06.115536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:06.206497Z","title":"A new path: Scaling vision-and-language navigation with synthetic instructions and imitation learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:06.206497Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:298540647af28ab1aa0c556274531efc006189c7d72ceab50bdb2bcab2b18c3b","observation_id":"2b74cb38-30b9-478f-b2b5-f532924a3b4e","resolution":{"observed_at":"2026-08-07T13:52:06.206497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:06.303775Z","title":"Tactical rewind: Self-correction via backtracking in vision-and-language navigation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:06.303775Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:f81c82f0bb2b4ddd8680e69936bc3a7ee94fef222a6429a0dcf6a88eb8008278","observation_id":"be272503-4ecc-4650-83fb-d66759b44dd2","resolution":{"observed_at":"2026-08-07T13:52:06.303775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:06.466697Z","title":"3d gaussian splatting for real-time radiance field rendering.ACM Trans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:06.466697Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:3cd4b0a04ff47e1a6d5d0001f0d8590860a0a5f7a978ad43762643118702c031","observation_id":"9cd2fe71-3e52-4aa9-97c4-01d560c0a945","resolution":{"observed_at":"2026-08-07T13:52:06.466697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:06.635103Z","title":"Bandit based monte-carlo planning","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:06.635103Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:6e144548cd6b1a1f64eb805541dc1799bcdc70928e8f0913df3eb3de8812595a","observation_id":"02edb41f-8325-47bc-9775-ce17e7517623","resolution":{"observed_at":"2026-08-07T13:52:06.635103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:06.801988Z","title":"Pathdreamer: A world model for indoor navigation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:06.801988Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:3ba3bc2165ffbaaa94eebad935e31dddfd1241144ebedbed0dd358f2c07ada13","observation_id":"1c9106b3-0f09-4566-adf6-b66014f42b1c","resolution":{"observed_at":"2026-08-07T13:52:06.801988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:06.959660Z","title":"Waypoint models for instruction-guided navigation in continuous environments","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:06.959660Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:e155f42e08359cffa64dac324d69fcc9d202bbc2180124b97413cf17fa0d92df","observation_id":"e87c3895-98f2-41be-ac90-c471209c4116","resolution":{"observed_at":"2026-08-07T13:52:06.959660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:07.126242Z","title":"Beyond the nav-graph: Vision-and-language navigation in continuous environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:07.126242Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:ea7b319e64baf82fbe0bad9ae3bb6baafa4653928ec52b089523daed5fb63dd4","observation_id":"415a147e-f81a-415b-b080-e8aedb3daed1","resolution":{"observed_at":"2026-08-07T13:52:07.126242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-08-17T11:39:02.437980Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-07T13:52:07.294284Z","title":"Room-across-room: Multilingual vision-and-language navigation with dense spatiotemporal grounding.arXiv preprint arXiv:2010.07954, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:07.294284Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:3def57cd407d7341efc2f0495a0d036caa7645f93f6e03cc0af567ea51f44746","observation_id":"7dfd67f3-cb68-4b50-9467-5d061a57ead8","resolution":{"observed_at":"2026-08-07T13:52:07.294284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14240","last_updated":"2025-08-02T16:25:00Z","snapshot_observed_at":"2026-08-16T13:41:08.731128Z","submitted_at":"2024-06-20T12:08:27Z","title":"CityNav: A Large-Scale Dataset for Real-World Aerial Navigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14240","snapshot_observed_at":"2026-08-07T13:52:07.418412Z","title":"Citynav: Language-goal aerial navigation dataset with geographic information.arXiv preprint arXiv:2406.14240, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:07.418412Z"},"links":{"cited_paper":"/paper/2406.14240","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:7ba63e47cc877be9584d6fc19f5efbccf83299c697b926a14946be9554dc4b9e","observation_id":"aff2a36e-f605-4d5c-8bb8-a51dcc47365d","resolution":{"observed_at":"2026-08-07T13:52:07.418412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:07.564453Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:07.564453Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:c1c640c6a0c86141ad8da0b7656f0d08027cd5020183a73a91fb4f0cb16b4e53","observation_id":"b30eef78-0f9d-4819-b6ea-a15ec3c35ce9","resolution":{"observed_at":"2026-08-07T13:52:07.564453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:07.738763Z","title":"Panogen: Text-conditioned panoramic environment generation for vision-and- language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:07.738763Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:5d4e61a336fdf3733a132ff5841d0e1c51352a796b0e90f0471e554a53bb29b9","observation_id":"1f285e91-5dea-4ae2-b0b3-2991ce4269cb","resolution":{"observed_at":"2026-08-07T13:52:07.738763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:07.891511Z","title":"Envedit: Environment editing for vision-and-language navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:07.891511Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:4726d81eb96f0d4e3efbbf5c3b54965b2e1a1eb93c304fca2583f943537dc6a4","observation_id":"3f2686dd-fe87-4016-8ee5-1dc7c2610818","resolution":{"observed_at":"2026-08-07T13:52:07.891511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:22.404480Z","title":"Walking with mind: Mental imagery enhanced embodied qa","venue":null,"work_id":"f09caa6c-fab4-479a-9846-aa3e84af9a0d","year":null},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:08.018369Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:39a08e75e66117161af164fd25be02e7fd03fb53aebf60d9ddd62e561b8532d4","observation_id":"7d548cc0-0d64-4de1-a141-c02eb4647d61","resolution":{"observed_at":"2026-08-07T13:52:22.472893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:22.245131Z","title":"Blip-2: Bootstrapping language-image pre- training with frozen image encoders and large language models","venue":null,"work_id":"e9033bb6-e162-4941-9a9b-3446351ba968","year":2023},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:08.159320Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:65301f44a57b004fcc7e16c9994742766f643a686d07357d5e91949e5e588bae","observation_id":"c2357454-6401-4e4b-954a-54f55aab4ff2","resolution":{"observed_at":"2026-08-07T13:52:22.316260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:22.027381Z","title":"Kerm: Knowledge enhanced reasoning for vision-and-language navigation.2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 2583–2592, 2023","venue":null,"work_id":"cf414463-7af6-43b5-bd98-6a3976a8b189","year":2023},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:08.288970Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:ee951cc134f41bccf75f1164b74d52d2e6dc5e9bc0d8ae02db9d4a0bcbfbf61f","observation_id":"b1fbefe8-8c03-49b0-808d-a92d57331a54","resolution":{"observed_at":"2026-08-07T13:52:22.118287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07376","last_updated":"2025-03-22T11:04:36Z","snapshot_observed_at":"2026-08-16T14:10:41.992728Z","submitted_at":"2024-03-12T07:27:02Z","title":"NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07376","snapshot_observed_at":"2026-08-07T13:52:08.447862Z","title":"Navcot: Boosting llm-based vision-and-language navigation via learning disentangled reasoning.arXiv preprint arXiv:2403.07376, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:08.447862Z"},"links":{"cited_paper":"/paper/2403.07376","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:b6daeac2c16e773dc6e4dc0c89ae7833bd1737b93024cf80f221b2359109748f","observation_id":"a9b088ae-a266-4b10-96f5-44f2a69d28e9","resolution":{"observed_at":"2026-08-07T13:52:08.447862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:21.873007Z","title":"Correctable landmark discovery via large models for vision-language navigation.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":"479fae49-6f48-4fdc-a2db-a4c202c3dced","year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:08.634493Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:f6cf722bc26d77610a50ea5c96f4f9943f211df038e647429916feb463cf812b","observation_id":"b914feb4-defb-4452-bcde-d7c153f611d5","resolution":{"observed_at":"2026-08-07T13:52:21.937607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01399","last_updated":"2024-05-31T15:32:02Z","snapshot_observed_at":"2026-08-17T17:09:51.857542Z","submitted_at":"2023-07-31T17:57:49Z","title":"Learning to Model the World with Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01399","snapshot_observed_at":"2026-08-07T13:52:08.877322Z","title":"Learning to model the world with language.arXiv preprint arXiv:2308.01399, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:08.877322Z"},"links":{"cited_paper":"/paper/2308.01399","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:73caaf813dc21de03a2a546db1262b04ba778c27d6595e17dd6320bcde591b21","observation_id":"3e781315-3f64-4a8e-be74-b897a5190fe1","resolution":{"observed_at":"2026-08-07T13:52:08.877322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:21.682100Z","title":"V olumetric environment representation for vision-language navigation.2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 16317–16328, 2024","venue":null,"work_id":"a61140a6-9b66-44ba-ae74-ed85dba2ebf6","year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:09.068911Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:e3ecd2f1b1449a746dc2b31bfce75b7ecfec2e03bb4ac3963d7374cdbdd6015f","observation_id":"1665e227-cf40-481c-9fbe-2a3cf6500ba4","resolution":{"observed_at":"2026-08-07T13:52:21.801031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04882","last_updated":"2024-06-07T12:26:34Z","snapshot_observed_at":"2026-08-16T13:45:10.310910Z","submitted_at":"2024-06-07T12:26:34Z","title":"InstructNav: Zero-shot System for Generic Instruction Navigation in Unexplored Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04882","snapshot_observed_at":"2026-08-07T13:52:09.192295Z","title":"Instructnav: Zero-shot system for generic instruction navigation in unexplored environment.arXiv preprint arXiv:2406.04882,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:09.192295Z"},"links":{"cited_paper":"/paper/2406.04882","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:4a50c1028e3238912c31c165ec4a76f9598a3a04460b16e26f17ecd7ef5fd30c","observation_id":"07e1abf2-83e2-4bcd-a3ed-ea8cbdb93e36","resolution":{"observed_at":"2026-08-07T13:52:09.192295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:21.436898Z","title":"Discuss before moving: Visual language navigation via multi-expert discussions","venue":null,"work_id":"617bf79f-69ff-4fb5-8125-c1585689d7ad","year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:09.321932Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:c639d71dca4f3ad80e2e3629649e0f956771db2542fbea70a75da1cc875b4748","observation_id":"f5dcbf2b-cc5f-4200-82a5-b350dbe763cb","resolution":{"observed_at":"2026-08-07T13:52:21.543669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.03035","last_updated":"2019-01-10T06:46:50Z","snapshot_observed_at":"2026-08-17T16:30:44.107220Z","submitted_at":"2019-01-10T06:46:50Z","title":"Self-Monitoring Navigation Agent via Auxiliary Progress Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.03035","snapshot_observed_at":"2026-08-07T13:52:09.470511Z","title":"Self-monitoring navigation agent via auxiliary progress estimation.arXiv preprint arXiv:1901.03035,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:09.470511Z"},"links":{"cited_paper":"/paper/1901.03035","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:a646c97f199b7826f0dd739c7bfb225f8c04eeca7499b60fc5805558e6a2e31e","observation_id":"092dbfad-85b3-400e-a78d-5158070e2f75","resolution":{"observed_at":"2026-08-07T13:52:09.470511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:21.237717Z","title":"The regretful agent: Heuristic-aided navigation through progress estimation","venue":null,"work_id":"dd8b3f3d-3327-43ee-b518-eb84deb32220","year":2019},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:09.698811Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:3aeca880bceb24d5354db0df3fbde8c87be46da75dc08e2c98e6b31ba73d518c","observation_id":"e0b6a1d2-5d35-46f4-9687-cd1b50ba0682","resolution":{"observed_at":"2026-08-07T13:52:21.314368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-07T13:52:09.867578Z","title":"Language models are few-shot learners.arXiv preprint arXiv:2005.14165, 1:3, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:09.867578Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:5945b280a8057e201e42b2c67a43682170ba3c3e3b0565b1e14c86ca68197485","observation_id":"3871eb5f-4aa3-4367-b531-87d231a9d6dd","resolution":{"observed_at":"2026-08-07T13:52:09.867578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:20.989654Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis.Communications of the ACM, 65(1):99–106, 2021","venue":null,"work_id":"8e7a0a61-a637-4f8f-8bf5-b57bee1653b2","year":2021},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:10.042664Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:613d5efd1c4d11ef42d82a6466478ef7f2723da2b507ab93a2aab9900a43f2f8","observation_id":"0ec4296b-07a1-414e-a836-21b9be3af006","resolution":{"observed_at":"2026-08-07T13:52:21.065789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:20.847781Z","title":"Instant neural graphics primitives with a multiresolution hash encoding.ACM transactions on graphics (TOG), 41(4):1–15, 2022","venue":null,"work_id":"c16b1928-7701-4979-979f-27780fd9ca16","year":2022},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:10.150385Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:26a5c96814dea68af84ad93b3b39e6c148fc198bcbd0ed2f8618c864dc79a7c6","observation_id":"662401a7-4c82-447c-80d6-5da18c9767ce","resolution":{"observed_at":"2026-08-07T13:52:20.907470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01871","last_updated":"2019-11-22T16:11:17Z","snapshot_observed_at":"2026-08-17T23:03:49.545177Z","submitted_at":"2019-09-04T15:20:01Z","title":"Help, Anna! Visual Navigation with Natural Multimodal Assistance via Retrospective Curiosity-Encouraging Imitation Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01871","snapshot_observed_at":"2026-08-07T13:52:10.287649Z","title":"Help, anna! visual navigation with natural multimodal assistance via retrospective curiosity-encouraging imitation learning.arXiv preprint arXiv:1909.01871, 2019","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:10.287649Z"},"links":{"cited_paper":"/paper/1909.01871","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:8ffaf41480eec0beb3474d18bfaeb58478061b99540a324a9e680b4000301043","observation_id":"1bef775c-24aa-4aca-804d-3875e76162df","resolution":{"observed_at":"2026-08-07T13:52:10.287649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02247","last_updated":"2025-07-19T03:44:28Z","snapshot_observed_at":"2026-08-16T12:53:21.454608Z","submitted_at":"2025-03-04T03:51:36Z","title":"WMNav: Integrating Vision-Language Models into World Models for Object Goal Navigation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02247","snapshot_observed_at":"2026-08-07T13:52:10.367658Z","title":"Wmnav: Integrating vision- language models into world models for object goal navigation.arXiv preprint arXiv:2503.02247, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:10.367658Z"},"links":{"cited_paper":"/paper/2503.02247","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:9069bb569a8b9cc3c55751e4c42f59eba8098813f511f12c4c64fc6b121f8a07","observation_id":"291fbec7-3b52-47e5-ba80-c87254b82bd2","resolution":{"observed_at":"2026-08-07T13:52:10.367658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07889","last_updated":"2024-03-30T22:00:22Z","snapshot_observed_at":"2026-08-18T09:16:54.730430Z","submitted_at":"2023-10-11T20:52:30Z","title":"LangNav: Language as a Perceptual Representation for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07889","snapshot_observed_at":"2026-08-07T13:52:10.437049Z","title":"Langnav: Language as a perceptual representation for navigation.arXiv preprint arXiv:2310.07889, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:10.437049Z"},"links":{"cited_paper":"/paper/2310.07889","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:e8c31d99018c4ea76375e443023538e36ff97953330ebdaaadbe4f4e74ff7110","observation_id":"f76dcb61-8472-4d84-92e2-3f4a3ab34915","resolution":{"observed_at":"2026-08-07T13:52:10.437049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:20.617358Z","title":"Planning from imagination: Episodic simulation and episodic memory for vision-and-language navigation","venue":null,"work_id":"a8d474b0-1a62-4b35-b5d9-6caa726dfbcc","year":2025},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:10.517927Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:d66abb54fbe4e6ecbf384dc2414989be0e242b58ceb96dc295df3e16a5370331","observation_id":"8b8289dc-c38a-4de1-bae8-c863ca48a24a","resolution":{"observed_at":"2026-08-07T13:52:20.737437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:20.434022Z","title":"Episodic transformer for vision-and-language navigation","venue":null,"work_id":"c3fa2950-61b7-437b-aaab-057892b41605","year":2021},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:10.618340Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:cf1f32e47e73426735f685ed07d82ce8235135deaef8b09de384dd2bf554eda5","observation_id":"9b4d9cdd-ac58-4ed6-8d54-091bb1c05834","resolution":{"observed_at":"2026-08-07T13:52:20.514079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:20.205149Z","title":"Reverie: Remote embodied visual referring expression in real indoor environments","venue":null,"work_id":"2aa3c058-a4a0-4100-af9c-1b89f8f83263","year":null},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:10.729924Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:4d5bd1904bd062fd9939e52080dd9efc22f05ecb1012c86592662cd63a0c5c2f","observation_id":"6f8b71cd-c186-47c8-8e82-3f77c49a45b9","resolution":{"observed_at":"2026-08-07T13:52:20.322447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:20.015972Z","title":"Hop: History-and-order aware pre-training for vision-and-language navigation","venue":null,"work_id":"8624ade5-3441-4471-9ddd-894ac2c3f688","year":2022},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:10.822527Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:338e237fda159a333d6b42f76a11fdba0aa413eea60fdcfd73beff0882d69f98","observation_id":"73083f5f-a6a4-4678-862d-579b1760eaa7","resolution":{"observed_at":"2026-08-07T13:52:20.085934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:19.801022Z","title":"Hop+: History-enhanced and order-aware pre-training for vision-and-language navigation.IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(7):8524–8537, 2023","venue":null,"work_id":"307e09a7-e4c5-4a4d-aeb6-c436d5e9f1df","year":2023},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:10.906907Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:51607924dd792e552e1b046498f6c4881b029ec6d98cd402915f421947adeba4","observation_id":"0e8f0364-b36f-4cac-a56d-2f6c87d8482f","resolution":{"observed_at":"2026-08-07T13:52:19.917642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:19.594258Z","title":"March in chat: Interactive prompting for remote embodied referring expression","venue":null,"work_id":"eb774781-68d2-4d47-a4f9-133436745f72","year":2023},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:10.990220Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:7ff62132dfe2df3b716100d35d76f310de380cfe0a8dc116327821eeb89bbac8","observation_id":"9b557c80-6a75-4ebc-a066-6429f3685c9f","resolution":{"observed_at":"2026-08-07T13:52:19.682285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:19.328515Z","title":"Saynav: Grounding large language models for dynamic planning to navigation in new environments","venue":null,"work_id":"aaebc20c-e0fa-41a3-a438-63ad6e8b47f8","year":null},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:11.094377Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:f1a51db735fce8067cdc05309d0be9c1e7e89da20a07fb85fc3b23cba8d9dbe5","observation_id":"2b7a2666-0fe1-4522-9eb2-2ed78bf2a311","resolution":{"observed_at":"2026-08-07T13:52:19.470504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:11.161644Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:11.161644Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:32d19be00e1566ac1c116e9435aa9702777fdea289adeb531570fb864d565761","observation_id":"aff4ac6a-30ab-45d9-a2a9-4447c18beef9","resolution":{"observed_at":"2026-08-07T13:52:11.161644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:19.214933Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":"f8ec3cf7-c050-4fa0-99c6-a8d35e87d825","year":2011},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:11.252560Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:eedc2274d0c9c8f320adae9055f6f210a25f84b075c69113c9e47b51e09f73cd","observation_id":"5a4587a4-f74c-4ba3-bdf5-085952ce3057","resolution":{"observed_at":"2026-08-07T13:52:19.247406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:19.079616Z","title":"Lm-nav: Robotic navigation with large pre-trained models of language, vision, and action","venue":null,"work_id":"2efc6999-13c8-4776-b5ed-3ab979b406ea","year":2023},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:11.336770Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:c7ebd65abb7485bd74d206b4a1c7c4a8afc3712f4e1ec14e7739c958697f6a04","observation_id":"d8b0444c-c7bc-4d9d-b6f9-e6b5b176c889","resolution":{"observed_at":"2026-08-07T13:52:19.154976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16062","last_updated":"2025-05-05T06:53:10Z","snapshot_observed_at":"2026-08-18T09:21:58.315687Z","submitted_at":"2025-04-22T17:38:38Z","title":"ForesightNav: Learning Scene Imagination for Efficient Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16062","snapshot_observed_at":"2026-08-07T13:52:11.398022Z","title":"Foresightnav: Learning scene imagination for efficient exploration.arXiv preprint arXiv:2504.16062,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:11.398022Z"},"links":{"cited_paper":"/paper/2504.16062","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:06a42d84840410829d93323e502ceb88b03aa35fd4c10a0d9491e9ceb5b57f40","observation_id":"9c089721-ef6c-42d7-9c52-c5f3b6abfb02","resolution":{"observed_at":"2026-08-07T13:52:11.398022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:11.473603Z","title":"Alfred: A benchmark for interpreting grounded instructions for everyday tasks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:11.473603Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:60fbdcd6869910b94b06379167c3ceeacf58a9915b0e23e0bb8c27416cef24ff","observation_id":"06610e06-3201-483b-bb74-4a1ebaea7a37","resolution":{"observed_at":"2026-08-07T13:52:11.473603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:18.894427Z","title":"Sadler, Wei-Lun Chao, and Yu Su","venue":null,"work_id":"97ab1730-9584-453d-80a8-fd25499fe080","year":2023},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:11.560826Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:acf21c8f5598618695758b1565737df8ca81ab952a6b1d109e5f561f2fada487","observation_id":"7c5eabc2-8f6b-4e27-9f95-f3a22230b794","resolution":{"observed_at":"2026-08-07T13:52:18.991461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.04195","last_updated":"2019-04-08T17:14:52Z","snapshot_observed_at":"2026-08-17T14:44:30.657958Z","submitted_at":"2019-04-08T17:14:52Z","title":"Learning to Navigate Unseen Environments: Back Translation with Environmental Dropout","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.04195","snapshot_observed_at":"2026-08-07T13:52:11.640982Z","title":"Learning to navigate unseen environments: Back translation with environmental dropout.arXiv preprint arXiv:1904.04195, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:11.640982Z"},"links":{"cited_paper":"/paper/1904.04195","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:eaf9e2207b529f4130957e63dc808eca8148fe7842a472d67fc39724dbee9b70","observation_id":"00c3e71f-e90f-4e83-9a42-cdd5c22b1c9c","resolution":{"observed_at":"2026-08-07T13:52:11.640982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:18.753384Z","title":"Vision-and-dialog navigation","venue":null,"work_id":"1058ade3-b1ff-4746-89c6-ddfeea592f3a","year":2020},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:11.728983Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:fe134c81697578a986ec01811713180968b35a2dd27f9306e52c457c0a2d0b69","observation_id":"75863d7d-7cd0-4ab1-9e5f-d2eff03baa77","resolution":{"observed_at":"2026-08-07T13:52:18.812682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:11.799092Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:11.799092Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:959f86a276e0811dc6bc6e32ea5c312d164a5f72214539bbf036a85709cd0e41","observation_id":"9a8ab89d-fef4-435c-8fe2-387118abe524","resolution":{"observed_at":"2026-08-07T13:52:11.799092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:18.607660Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation.2023 IEEE/CVF International Conference on Computer Vision (ICCV), pages 10839–10849, 2023","venue":null,"work_id":"febf9724-02c8-498c-9859-9483fbc6f6c7","year":2023},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:11.857630Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:93da8903fa5c14e6a9f6b14bd22e045c66b615541dea763d0f50ae7db4ff4942","observation_id":"344a891f-1ec7-496b-879b-ea67ab60c890","resolution":{"observed_at":"2026-08-07T13:52:18.671936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:18.427552Z","title":"Counterfactual cycle- consistent learning for instruction following and generation in vision-language navigation","venue":null,"work_id":"82d80d72-c79c-48b9-ae7d-9e69a85358c5","year":2022},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:11.924948Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:5d6389a59a2dfe35fc614346efa899b7381e456fd462f68bdad807fd06b90d05","observation_id":"406ab400-bf30-46b0-8bbd-ef5ee58b7aaa","resolution":{"observed_at":"2026-08-07T13:52:18.500665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:18.251532Z","title":"Soft expert reward learning for vision-and-language navigation","venue":null,"work_id":"b56d1a17-4928-4d72-8598-4e9bb8f19ee2","year":2020},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:11.989064Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:9b44a2284b34e657fff5069d4321138ad6cd755be6a2635b97fed21357aad711","observation_id":"f224b974-5f98-4ce4-9677-d2bfe3dfc09b","resolution":{"observed_at":"2026-08-07T13:52:18.337905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:18.084004Z","title":"Panogen++: Domain-adapted text-guided panoramic environment generation for vision-and-language navigation.Neural Networks, 187:107320, 2025","venue":null,"work_id":"688ad706-1a33-47ed-8658-ffa98920592d","year":2025},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:12.062682Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:ab4eac16e3b9b1e016b3718b886f2569649284f00b1beff71e873aa98e046148","observation_id":"5e68d08a-b531-4955-b51d-666fd7fc04d7","resolution":{"observed_at":"2026-08-07T13:52:18.169164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00938","last_updated":"2025-02-15T10:36:03Z","snapshot_observed_at":"2026-08-16T13:13:50.189142Z","submitted_at":"2024-10-01T07:47:03Z","title":"MoS: Unleashing Parameter Efficiency of Low-Rank Adaptation with Mixture of Shards","version":2},"cited_work":{"arxiv_id":"2410.00938","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.00938","snapshot_observed_at":"2026-08-07T13:52:14.817878Z","title":"MoS: Unleashing Parameter Efficiency of Low-Rank Adaptation with Mixture of Shards","venue":"cs.LG","work_id":"487b9cd4-4196-427e-8e85-6a1211b33113","year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:12.148133Z"},"links":{"cited_paper":"/paper/2410.00938","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:92b848f4e717937f08cff7fb1eff4f9fe600de4fa00633ee0a73325a62d3836d","observation_id":"d90388b2-8708-4665-aff8-060b812b3eea","resolution":{"observed_at":"2026-08-07T13:52:14.873768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:17.893224Z","title":"Lana: A language-capable navigator for instruction following and generation","venue":null,"work_id":"72c277b5-2bc4-40a3-b4d3-7c1cfbb8dc2d","year":2023},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:12.233254Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:c72ac74c8b45ecd70e25884df8aa2f7b7013c72ed0a0a5168c73e1a190b0854d","observation_id":"53a30a52-93cb-406c-b84b-4c334cab46e7","resolution":{"observed_at":"2026-08-07T13:52:17.968080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:17.715609Z","title":"Reinforced cross-modal matching and self-supervised imita- tion learning for vision-language navigation","venue":null,"work_id":"6fc8e23a-0098-4400-ad17-e79dc41b970a","year":2019},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:12.298178Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:b93dbf177f40a60ea3d6165fbdad46c80bcbd04cd65803538f6b5f2ab0a18647","observation_id":"5973b4ad-3edc-4f44-8c8f-97ea897f9ed0","resolution":{"observed_at":"2026-08-07T13:52:17.810171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:17.544431Z","title":"Reinforced cross-modal matching and self-supervised imita- tion learning for vision-language navigation","venue":null,"work_id":"1cde5b2d-be64-46a4-873a-032c62cce4dd","year":2019},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:12.366398Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:f1e57e6227f271dc65ff5844282b5ba4c95e85e27bd7605fdf6362a46ec4b949","observation_id":"f27f2768-631b-433a-a158-a05cdbee1701","resolution":{"observed_at":"2026-08-07T13:52:17.633292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:17.323162Z","title":null,"venue":null,"work_id":"4622d56e-042d-486e-8c72-9190a6c5eb75","year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:12.435414Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:847bf7a14e4bab5a7b3b12775d0fff06a78264eecb762f3a8557c8fa48b163a9","observation_id":"6e11849a-c275-4052-a878-9d5c1e7a3e98","resolution":{"observed_at":"2026-08-07T13:52:17.452502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:17.145536Z","title":"Gridmm: Grid memory map for vision-and-language navigation","venue":null,"work_id":"f8df0ea1-4d7d-4a92-ae8a-3adb84c4bc25","year":2023},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:12.522932Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:9ef4e7eaf207bab68b26717170f7f64910817fa659129fd140abcc1c549f1159","observation_id":"5e8d8e46-221c-4e95-b9e5-2d52b2c43c48","resolution":{"observed_at":"2026-08-07T13:52:17.203929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:16.937455Z","title":"Scaling data generation in vision-and-language navigation.2023 IEEE/CVF International Conference on Computer Vision (ICCV), pages 11975–11986, 2023","venue":null,"work_id":"c24a8df2-cfb2-49a0-bee4-8ea9fde9cfa4","year":2023},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:12.620490Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:8fdd2263d1e1104ca00dc2eb3aa7ff8fe287e827bd42eb8609176e4825c71493","observation_id":"38a43a94-adbe-4a9e-964c-338f1e679b4c","resolution":{"observed_at":"2026-08-07T13:52:17.043592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:12.696915Z","title":"Unseen from seen: Rewriting observation-instruction using foundation models for augmenting vision-language navigation.arXiv preprint arXiv:2503.18065, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:12.696915Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:e2bbf3093757087fc829114eba17cb7950f34a88399b32305f9123ca55a8ba37","observation_id":"aab10eb1-6b28-44e2-a7cc-b02d7ec43c77","resolution":{"observed_at":"2026-08-07T13:52:12.696915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01828","last_updated":"2025-05-02T17:53:34Z","snapshot_observed_at":"2026-08-19T03:30:46.738662Z","submitted_at":"2025-02-03T21:11:02Z","title":"From Foresight to Forethought: VLM-In-the-Loop Policy Steering via Latent Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01828","snapshot_observed_at":"2026-08-07T13:52:12.773873Z","title":"From foresight to forethought: Vlm-in-the-loop policy steering via latent alignment.arXiv preprint arXiv:2502.01828, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:12.773873Z"},"links":{"cited_paper":"/paper/2502.01828","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:44d3c91623f4cb9e6d6bb94d8a0e178fb0587ac7b1d3eeddeccd859cf3a7b5a2","observation_id":"1d242b21-9e3d-4f4d-8f34-46a78bc0a80c","resolution":{"observed_at":"2026-08-07T13:52:12.773873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:52:16.716589Z","title":"Flame: Learning to navigate with multimodal llm in urban environments","venue":null,"work_id":"0c61608b-e073-4965-a10b-d4431265bf24","year":2025},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:12.836234Z"},"links":{"citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:c53027691a2e43a434defb2d5b0c63b53d627399380c679f5bac71bb7c628143","observation_id":"ebafa05a-f72e-4bd3-88ef-7a7adbc42e4a","resolution":{"observed_at":"2026-08-07T13:52:16.783222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:52:12.903929Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:12.903929Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:76ba80d70c5773ed29801df867377bb30d84c8e67f3a7bd04eec831254221d10","observation_id":"9aae087c-78e1-42f0-b18c-c8dc51efdb06","resolution":{"observed_at":"2026-08-07T13:52:12.903929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10620","last_updated":"2024-08-12T14:07:32Z","snapshot_observed_at":"2026-08-18T09:12:32.566361Z","submitted_at":"2024-05-17T08:33:27Z","title":"MC-GPT: Empowering Vision-and-Language Navigation with Memory Map and Reasoning Chains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10620","snapshot_observed_at":"2026-08-07T13:52:12.988845Z","title":"Mc-gpt: Empowering vision-and-language navigation with memory map and reasoning chains.arXiv preprint arXiv:2405.10620, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:12.988845Z"},"links":{"cited_paper":"/paper/2405.10620","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:ed80f20297c970893fec657dd91ea503a79fb3a0c8162572a98b5aea9acb9be9","observation_id":"c82d4f1a-b1be-4214-ad16-73fcfcc3aef2","resolution":{"observed_at":"2026-08-07T13:52:12.988845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-08-16T16:28:01.153501Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06224","snapshot_observed_at":"2026-08-07T13:52:13.046533Z","title":"Uni-navid: A video-based vision-language-action model for unifying embodied navigation tasks.arXiv preprint arXiv:2412.06224, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:13.046533Z"},"links":{"cited_paper":"/paper/2412.06224","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:61c6b8225709cc3ffdedec24ff96bc5931e2295b7c3232afed8dd7f755092150","observation_id":"1d55dd80-c920-462e-9b07-c144455c1b58","resolution":{"observed_at":"2026-08-07T13:52:13.046533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-08-18T12:12:42.503422Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15852","snapshot_observed_at":"2026-08-07T13:52:13.126479Z","title":"Navid: Video-based vlm plans the next step for vision-and-language navigation.arXiv preprint arXiv:2402.15852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:13.126479Z"},"links":{"cited_paper":"/paper/2402.15852","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:b3fff023b8b92a9192541770c99c467c60d84bb30185b50d4f18f8c2077a9258","observation_id":"96476ab5-21a1-4c4b-94cb-ac249b3a7226","resolution":{"observed_at":"2026-08-07T13:52:13.126479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13451","last_updated":"2026-05-09T11:40:06Z","snapshot_observed_at":"2026-08-16T21:44:26.869362Z","submitted_at":"2025-02-19T05:52:34Z","title":"MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13451","snapshot_observed_at":"2026-08-07T13:52:13.187878Z","title":"Mapnav: A novel memory representation via annotated semantic maps for vlm-based vision-and-language navigation.arXiv preprint arXiv:2502.13451,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:13.187878Z"},"links":{"cited_paper":"/paper/2502.13451","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:27164e020ecd23fcaa954d37dc90caf41f95160156c7f205810f9829ce5da3c0","observation_id":"eaebd937-9f9a-46cd-94ed-bddcce47f0a6","resolution":{"observed_at":"2026-08-07T13:52:13.187878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":4,"verified_fuzzy":30},"total_outbound_references":111},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 111 outbound references and 5 inbound Pith citation observations for arXiv:2505.20897."}