{"as_of":"2026-08-07T23:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:156a51822536a290fe271ce843252337ca296898b059de7a22945b0f8d3a4180","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:37:06.534556Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":54,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:31:40.601037Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T02:27:48.997495Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-08-05T20:31:09.130917Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10416","last_updated":"2025-08-14T07:39:26Z","snapshot_observed_at":"2026-08-05T20:31:02.876795Z","submitted_at":"2025-08-14T07:39:26Z","title":"CorrectNav: Self-Correction Flywheel Empowers Vision-Language-Action Navigation Model","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T20:31:09.130917Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2508.10416"},"observation_digest":"sha256:ac457cd7a4e18b1c2de143e75cdca0b17b18a641b4ffc4eaef67102cf1670d8b","observation_id":"b2de16a7-714b-4211-9327-41f774905747","resolution":{"observed_at":"2026-08-05T20:31:09.130917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-08-04T17:31:43.003448Z","title":"Streamvln: Streaming vision-and-language navigation via slowfast context modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-06T23:06:21.884601Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:43.003448Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:dde38c8a9ca13adaa67b22944d7b871076ad0fe90e4f5497e818cc94d8271e16","observation_id":"4587285b-ab9f-4591-ad7c-fed4f4c6fc10","resolution":{"observed_at":"2026-08-04T17:31:43.003448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2511.17097","last_updated":"2026-04-14T15:21:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-21T09:52:07Z","title":"Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T21:02:38.013115Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2511.17097"},"observation_digest":"sha256:bd397bd24c2eb0c253c62ac7df72e6bbaeaabe3317f05a942da179995760217b","observation_id":"2c49428f-c9e1-4d24-a360-30e4c71bfa2a","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-08-03T17:18:19.601385Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling.arXiv preprint arXiv:2507.05240, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10310","last_updated":"2026-06-29T06:58:00Z","snapshot_observed_at":"2026-08-03T17:18:14.856704Z","submitted_at":"2025-12-11T05:57:48Z","title":"Efficient-VLN: A Simple yet Strong Baseline for Efficient Vision-Language Navigation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T17:18:19.601385Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2512.10310"},"observation_digest":"sha256:b940d4177e55d58d4cdb2e9b7a95682b1f213c02d2d0bbf905d8fcd94a06fa61","observation_id":"bf0af0d9-9606-4359-817d-51f9ee3a1dee","resolution":{"observed_at":"2026-08-03T17:18:19.601385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2512.21714","last_updated":"2026-04-08T16:31:40Z","snapshot_observed_at":"2026-08-03T01:54:32.856831Z","submitted_at":"2025-12-25T15:31:24Z","title":"AstraNav-World: World Model for Foresight Control and Consistency","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T19:23:58.769472Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2512.21714"},"observation_digest":"sha256:c115ed8ef289232335517536c81be541ee6c5b7f15d83cc17e8106c16b7b21cf","observation_id":"3c942637-7af2-4729-8768-4c1b6cbe1b21","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2603.05377","last_updated":"2026-06-28T10:51:16Z","snapshot_observed_at":"2026-08-02T22:18:25.610175Z","submitted_at":"2026-03-05T17:02:22Z","title":"OpenFrontier: General Navigation with Visual-Language Grounded Frontiers","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T11:36:24.334860Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2603.05377"},"observation_digest":"sha256:bf65a3e651d797700e58901771672bd4bb33daada5ba38a5aa63be8a52b406bf","observation_id":"8d21f7f6-9181-49c8-8a7e-b89e56fcd891","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2603.07080","last_updated":"2026-04-29T05:35:06Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T07:30:35Z","title":"VLN-Cache: Enabling Token Caching for VLN Models with Visual/Semantic Dynamics Awareness","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:58.269817Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2603.07080"},"observation_digest":"sha256:f7b05a01468603cb199f544ac9ebd41291e73ba728d108a405ca4e0597ac32b6","observation_id":"14dcf89f-d174-4c3c-83f4-3cbe16fefee9","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2603.16947","last_updated":"2026-05-16T14:04:23Z","snapshot_observed_at":"2026-07-06T22:49:28.866886Z","submitted_at":"2026-03-16T14:07:51Z","title":"LightZeroNav: Zero-Shot Vision Language Navigation in Continuous Environments Based on Lightweight VLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T10:41:47.297072Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2603.16947"},"observation_digest":"sha256:faae4c6c835fb1a6b44553f194bb0343a5e27c6c2ebfc019635bc1310920fdac","observation_id":"217214d1-4666-40e3-87d4-c293490d4e9c","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-08-02T17:15:42.466280Z","title":"arXiv preprint arXiv:2507.05240 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.27577","last_updated":"2026-08-01T10:28:12Z","snapshot_observed_at":"2026-08-06T23:11:01.804659Z","submitted_at":"2026-03-29T08:34:05Z","title":"Structured Observation Language for Efficient and Generalizable Vision-Language Navigation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T17:15:42.466280Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2603.27577"},"observation_digest":"sha256:438831ad4e8b2726952eeae8da1d5a0e3afdfc094c8de76eeb0e30e2dbd9d97f","observation_id":"653e5bef-c4bf-4433-9033-1965d98b3020","resolution":{"observed_at":"2026-08-02T17:15:42.466280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-08-04T05:43:12.553804Z","title":"arXiv preprint arXiv:2507.05240 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.27577","last_updated":"2026-08-01T10:28:12Z","snapshot_observed_at":"2026-08-06T23:11:01.804659Z","submitted_at":"2026-03-29T08:34:05Z","title":"Structured Observation Language for Efficient and Generalizable Vision-Language Navigation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T05:43:12.553804Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2603.27577"},"observation_digest":"sha256:5c66dee69c2448621c805b3e421e88e3cf05fd6bfc04909fc6aa545c00d3f49b","observation_id":"eb6c8ea4-5e11-47c8-acfc-c1a46dae0cdc","resolution":{"observed_at":"2026-08-04T05:43:12.553804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2604.16298","last_updated":"2026-04-17T17:59:48Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:59:48Z","title":"FineCog-Nav: Integrating Fine-grained Cognitive Modules for Zero-shot Multimodal UAV Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T08:13:12.029402Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2604.16298"},"observation_digest":"sha256:a9c2a2831236e8b373317f25f4cbe6513882118721a01732b5e746593219abd4","observation_id":"6ef8e15d-04bf-4dc9-93fa-63b2bf046875","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2604.17407","last_updated":"2026-04-19T12:30:22Z","snapshot_observed_at":"2026-08-02T21:38:53.966924Z","submitted_at":"2026-04-19T12:30:22Z","title":"Think before Go: Hierarchical Reasoning for Image-goal Navigation","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-10T05:43:27.972164Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2604.17407"},"observation_digest":"sha256:c1f76dc7973f81b9e952e9496929fa6fcf41fcea88c095bc06bff4eef561492a","observation_id":"45cc06b1-8688-428c-83f8-b1b4ec15f1c1","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2604.17473","last_updated":"2026-06-23T08:05:53Z","snapshot_observed_at":"2026-08-01T16:55:52.786011Z","submitted_at":"2026-04-19T15:03:38Z","title":"Dual-Anchoring: Addressing State Drift in Vision-Language Navigation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-10T06:50:34.310831Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2604.17473"},"observation_digest":"sha256:320451543468de173be90084f90f8bd317ce4a19dc9131396e1f272d3eed2ea3","observation_id":"3c48c546-de92-4b44-ac51-701dad9ccf18","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-12T18:51:26.143516Z","title":"StreamVLN: Streaming vision-and-language navigation via slowfast context modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.19535","last_updated":"2026-07-08T08:00:17Z","snapshot_observed_at":"2026-08-02T09:44:11.165443Z","submitted_at":"2026-04-21T14:54:24Z","title":"Existence of small semi-vortex solutions for the cubic nonlinear Schr\\\"{o}dinger system with Rashba type Spin-Orbit coupling on $\\mathbb{R}^2$","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T18:51:26.143516Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2604.19535"},"observation_digest":"sha256:1b27e8b01d71e11bdd094ad86f6d3f169e531fcb54534c95949799c8c23a9846","observation_id":"faaa55f3-d870-4c97-8899-05c840f53efe","resolution":{"observed_at":"2026-07-12T18:51:26.143516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2604.19536","last_updated":"2026-04-21T14:55:51Z","snapshot_observed_at":"2026-07-06T23:06:12.542013Z","submitted_at":"2026-04-21T14:55:51Z","title":"LiveVLN: Breaking the Stop-and-Go Loop in Vision-Language Navigation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:23.379734Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2604.19536"},"observation_digest":"sha256:b24d269ae6b205ba4ab588c910746575d2fd4dd4b127a12c91c2ca3cde658ffd","observation_id":"ab54c9d6-c0e0-4d7c-a30c-e1d71dd5c6bc","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2604.24391","last_updated":"2026-04-27T12:20:53Z","snapshot_observed_at":"2026-07-06T23:10:24.992210Z","submitted_at":"2026-04-27T12:20:53Z","title":"FreqCache: Accelerating Embodied VLN Models with Adaptive Frequency-Guided Token Caching","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T03:10:29.477937Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2604.24391"},"observation_digest":"sha256:a685aabf18ac6206d6ba536b8b0acde1f48d664e70c3fea1bd96fd8a6fa41676","observation_id":"ade1d0c2-2fbf-4c02-afb6-6cd0b1c7e553","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2604.27620","last_updated":"2026-04-30T09:09:40Z","snapshot_observed_at":"2026-08-02T10:15:35.110642Z","submitted_at":"2026-04-30T09:09:40Z","title":"SpaAct: Spatially-Activated Transition Learning with Curriculum Adaptation for Vision-Language Navigation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-07T05:05:33.606975Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2604.27620"},"observation_digest":"sha256:8e0a6a7fdd8388b77268db993f7f7f3b3e034044b0cafc9f6d75c5299553ea5a","observation_id":"b7da6bd7-da02-4781-96ea-010cb130f03c","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2605.09053","last_updated":"2026-05-09T16:56:38Z","snapshot_observed_at":"2026-08-02T10:23:06.582386Z","submitted_at":"2026-05-09T16:56:38Z","title":"LCGNav: Local Candidate-Aware Geometric Enhancement for General Topological Planning in Vision-Language Navigation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T02:04:57.627160Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2605.09053"},"observation_digest":"sha256:3444c551912eda285ffc92f47411f760152960969fc858a7137472fa8f5e841d","observation_id":"150b453d-f45f-4709-a1c2-f906d238b095","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2605.09441","last_updated":"2026-05-10T09:34:05Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T09:34:05Z","title":"Beyond Isolation: A Unified Benchmark for General-Purpose Navigation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T04:33:53.557357Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2605.09441"},"observation_digest":"sha256:7dfcf46158cd19be2cbd96577a1168b36876f7cdf789b40a4c7c23f8a5f61fdb","observation_id":"e2fdc933-7aa6-46ed-acd9-72cb88c729ee","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:8d1961d401a673b1f17fa0e32aa600a1940f34b8630222a7243d646ae21cbce9","observation_id":"191a073c-a88f-4214-9dda-cbe1adb50dc3","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2605.12624","last_updated":"2026-05-14T17:59:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T18:09:42Z","title":"MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-14T20:54:50.887381Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2605.12624"},"observation_digest":"sha256:6e584840d1b7d94698aac70f5b0a56e7eb355fed1e4c6e9c1d358aaef35992b6","observation_id":"741707e9-0f07-432f-a0f5-fa3b721e0f8b","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2605.12624","last_updated":"2026-05-14T17:59:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T18:09:42Z","title":"MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-15T05:07:58.953866Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2605.12624"},"observation_digest":"sha256:6757ddfb34339aa0bac481bb423988891208db12b51bad93de1d512288db5572","observation_id":"cf1bd163-89d5-49d5-9956-379b7a459278","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2605.13169","last_updated":"2026-05-15T16:50:42Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T08:31:22Z","title":"PanoWorld: Towards Spatial Supersensing in 360$^\\circ$ Panorama World","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-14T20:40:59.877854Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2605.13169"},"observation_digest":"sha256:9b02bdf7d45ae769898ebdf023336d0186b3904d96aa42b30725dae907e3f294","observation_id":"45a9a7de-3aa9-4807-82cb-4ab099d64764","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2605.13169","last_updated":"2026-05-15T16:50:42Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T08:31:22Z","title":"PanoWorld: Towards Spatial Supersensing in 360$^\\circ$ Panorama World","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T16:57:03.172340Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2605.13169"},"observation_digest":"sha256:ae62dcd5c7573205ff65c67eec8ea235ad9ddaeed8018767c0c5b94b5a0aa09d","observation_id":"42e39c8d-eacb-47f6-ab41-c6681a665456","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2605.13328","last_updated":"2026-05-13T10:41:24Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T10:41:24Z","title":"What Limits Vision-and-Language Navigation ?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T17:59:58.891151Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2605.13328"},"observation_digest":"sha256:c42e85ea4b720cf0f7a275030f37faf34b20bedd5ed3901196016df55daf1668","observation_id":"8fa5b160-d3d0-4b95-9686-6349ee77f524","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2605.17249","last_updated":"2026-06-04T15:16:16Z","snapshot_observed_at":"2026-08-02T18:37:17.554035Z","submitted_at":"2026-05-17T04:12:56Z","title":"SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T13:31:16.012419Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2605.17249"},"observation_digest":"sha256:a2725e13f78a73f298d15e588e42f6614bd47bd84d07ed9e5875b4467eb90ee6","observation_id":"c37c7315-a25e-484d-88d1-25b4733c21cb","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2605.17249","last_updated":"2026-06-04T15:16:16Z","snapshot_observed_at":"2026-08-02T18:37:17.554035Z","submitted_at":"2026-05-17T04:12:56Z","title":"SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T19:42:41.238072Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2605.17249"},"observation_digest":"sha256:17cd5708af87a05e17bbdcb0f85d15aec57beaf77f2ad4d12c17f5b6336474be","observation_id":"a6e91a8e-0f90-4f9d-8334-fde2c0916773","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2605.22036","last_updated":"2026-05-21T06:20:17Z","snapshot_observed_at":"2026-08-03T01:34:12.134807Z","submitted_at":"2026-05-21T06:20:17Z","title":"GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T06:45:35.920991Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2605.22036"},"observation_digest":"sha256:1eceb27986375c6600d261eff756c67430412dd33dc9df305fda076c61906507","observation_id":"bd15211b-f171-4fcf-840b-4a377359cf42","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2605.22816","last_updated":"2026-05-21T17:58:26Z","snapshot_observed_at":"2026-08-03T04:05:29.788502Z","submitted_at":"2026-05-21T17:58:26Z","title":"AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T04:46:03.020800Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2605.22816"},"observation_digest":"sha256:cfa15b33c26bb898149bde2b232fd866f315c7d0ab1ff41cbe27c30472707c68","observation_id":"134d7494-b0f0-4396-bf3e-498cb0861b5b","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2605.27582","last_updated":"2026-05-26T18:52:04Z","snapshot_observed_at":"2026-07-06T23:37:16.981482Z","submitted_at":"2026-05-26T18:52:04Z","title":"Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T17:01:20.073666Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2605.27582"},"observation_digest":"sha256:80b42373d23de0742e4a33b7fce4294cc73ee5dc35591993d3a285ec059bd1b1","observation_id":"aa6fd94a-5697-4095-93cc-0feb4ef7d4c4","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2605.28237","last_updated":"2026-05-27T09:50:16Z","snapshot_observed_at":"2026-08-06T23:55:29.770936Z","submitted_at":"2026-05-27T09:50:16Z","title":"POINav: Benchmarking and Enhancing Final-Meters Arrival in Real-World Vision-Language Navigation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T11:48:14.888295Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2605.28237"},"observation_digest":"sha256:18571dfe8b20e944733356aeb05ce94b7eb0ef56177cb74bececa5b4444e7022","observation_id":"09c6ba14-c83e-48a0-9560-839fbac711df","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2605.31121","last_updated":"2026-05-29T10:30:36Z","snapshot_observed_at":"2026-08-05T05:04:02.567455Z","submitted_at":"2026-05-29T10:30:36Z","title":"TARIC: Memory-Augmented Traversability-Aware Outdoor VLN under Interrupted Semantic Cues","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T22:09:07.785292Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2605.31121"},"observation_digest":"sha256:cd50820be6a66ca737f6c96e48e81813798cd4783a21e7bb57d81e4e20e22fc2","observation_id":"b1d706e1-3f63-4d29-80d9-56198028d780","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2606.01241","last_updated":"2026-06-02T03:11:27Z","snapshot_observed_at":"2026-08-07T02:28:05.002889Z","submitted_at":"2026-05-31T13:43:23Z","title":"OneVLA: A Unified Framework for Embodied Tasks","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T17:05:08.124096Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2606.01241"},"observation_digest":"sha256:f44a5e4b42958142b503ec48e9a4c4cdc42bf5379073c223f2cdc7939be81c08","observation_id":"71d33fdf-bd20-4dd1-81b9-be4ff0fcb5aa","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2606.01621","last_updated":"2026-06-11T13:52:08Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:58Z","title":"Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:13.803571Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2606.01621"},"observation_digest":"sha256:48899acaa38ae8f426a2a7f720657fb1791b1fc1258d8ca3298c223d3313f7f6","observation_id":"116fb1b3-902f-48a1-9c56-778e009d468b","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2606.07244","last_updated":"2026-06-05T13:11:39Z","snapshot_observed_at":"2026-08-03T01:43:22.064081Z","submitted_at":"2026-06-05T13:11:39Z","title":"Beyond Waypoints: A Trajectory-Centric Waypointing Paradigm for Vision-Language Navigation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T21:40:58.329546Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2606.07244"},"observation_digest":"sha256:b35560e41b8c21bf4a1df2890fb9aa9b41f127fbe672b80c176560e691dca251","observation_id":"5b167f9b-3fd9-4446-8918-6df6fd5abdab","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2606.20458","last_updated":"2026-06-18T16:40:07Z","snapshot_observed_at":"2026-08-07T03:20:01.050993Z","submitted_at":"2026-06-18T16:40:07Z","title":"Slow Brain, Fast Planner: Latency-Resilient VLM-Augmented Urban Navigation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T17:16:52.173943Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2606.20458"},"observation_digest":"sha256:30b6bda2ebb8657a80646d687e8caeb4e0a9b0b244c6da23cd5fff11c06b9c5f","observation_id":"a4170dc7-cf4a-4b14-ac9b-a2763b876e97","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2606.27807","last_updated":"2026-06-26T07:45:45Z","snapshot_observed_at":"2026-07-07T00:01:59.695342Z","submitted_at":"2026-06-26T07:45:45Z","title":"SpikeVLA: Vision-Language-Action Models with Spiking Neural Networks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T04:42:23.040915Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2606.27807"},"observation_digest":"sha256:0e15b8f90de3125166d04c661d07177fb105587ae7b0e3343436534526b770f6","observation_id":"a0b2007b-4438-46a3-9b5d-3a65a008b512","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2606.30367","last_updated":"2026-06-29T14:33:03Z","snapshot_observed_at":"2026-08-06T15:33:36.109677Z","submitted_at":"2026-06-29T14:33:03Z","title":"FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T05:05:56.065261Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2606.30367"},"observation_digest":"sha256:979db8e43fefcada988acc1e7b3e3693c1698ae8e25ba679d4a0bf496b656523","observation_id":"194dc1f9-4351-4676-a226-02076be9dec7","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2607.01754","last_updated":"2026-07-02T06:11:07Z","snapshot_observed_at":"2026-08-02T15:41:12.241586Z","submitted_at":"2026-07-02T06:11:07Z","title":"Path-level Hindsight Instructions for Semantic Exploration in Vision-Language Navigation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-03T14:04:46.400336Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.01754"},"observation_digest":"sha256:c55079fa323f793bf9b9985a4d37058ade022c8c88bd88b328de0fa2f0ebf9a3","observation_id":"39bd6d97-f81c-46e9-a85a-6b0c9337e069","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2607.02417","last_updated":"2026-07-02T16:48:43Z","snapshot_observed_at":"2026-08-02T16:44:23.076809Z","submitted_at":"2026-07-02T16:48:43Z","title":"LIME: Learning Intent-aware Camera Motion from Egocentric Video","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-03T11:01:22.425665Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.02417"},"observation_digest":"sha256:db61db8764e8c3ade29f89546bffa0c5075d99689ac918620fb90a1582265199","observation_id":"3c0c299d-7885-46f2-a820-2c75e7b79f35","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Streamvln: Streaming vision-and-language navigation via slowfast context modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:fc30d18175c636ba492c2e945b4d272eaac83f5d34963a834dd9ae54a13e0448","observation_id":"eb84062f-aa1c-4a85-998a-0afa452ba9d4","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2607.05765","last_updated":"2026-07-07T02:42:41Z","snapshot_observed_at":"2026-08-05T08:15:29.125767Z","submitted_at":"2026-07-07T02:42:41Z","title":"Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-07-11T02:17:51.026130Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.05765"},"observation_digest":"sha256:da6ecd9b085e6b2cc950a16712a25c01483016dd337984951927ac5d8be838cf","observation_id":"a1a82472-770e-4e09-bc0a-609bd5ab1617","resolution":{"observed_at":"2026-07-11T02:27:49.014528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-14T15:39:59.878169Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09792","last_updated":"2026-07-09T05:13:02Z","snapshot_observed_at":"2026-08-07T21:59:36.828483Z","submitted_at":"2026-07-09T05:13:02Z","title":"A Comprehensive Survey and Systematic Real-World Evaluation of Embodied Vision-and-Language Navigation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T15:39:59.878169Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.09792"},"observation_digest":"sha256:3907bcaa80e6b749f6a5ae3b9cb5a8c32ce81b963082862a40f55432044fdc7b","observation_id":"be41978a-e6a9-469a-a9c0-b2f8c2f53114","resolution":{"observed_at":"2026-07-14T15:39:59.878169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-14T12:10:21.115628Z","title":"Streamvln: Streaming vision-and-language navigation via slowfast context modeling.arXiv preprint arXiv:2507.05240, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T19:07:58.422812Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-14T12:10:21.115628Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:b5fe83abf8f2e152474527c1e5bb33b79dbeefca3256cf6b69cc53e4b8cfeca6","observation_id":"5d82446a-78e4-4511-94a6-5cd256284c50","resolution":{"observed_at":"2026-07-14T12:10:21.115628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-08-02T07:19:43.503753Z","title":"Streamvln: Streaming vision-and-language navigation via slowfast context modeling.arXiv preprint arXiv:2507.05240, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T19:07:58.422812Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:43.503753Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:356c786056f975b4dc12344e1841fdda97309320c584c18ec9d9dba23ee6bd2d","observation_id":"35ace54b-82f0-409c-bcfd-8e99ef9ab06b","resolution":{"observed_at":"2026-08-02T07:19:43.503753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-08-02T05:13:53.937100Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13461","last_updated":"2026-07-15T05:46:34Z","snapshot_observed_at":"2026-08-02T14:26:06.309901Z","submitted_at":"2026-07-15T05:46:34Z","title":"Joint On-and-Off Policy Learning for Vision-and-Language Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T05:13:53.937100Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.13461"},"observation_digest":"sha256:60a6b3eeb9982a81d27fc6ff61eeb07897fa1cf8f9bb9a4d6aa87f08e044c23f","observation_id":"9d75388c-2b0f-4b72-9303-ff1331f411e1","resolution":{"observed_at":"2026-08-02T05:13:53.937100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-08-01T19:56:51.921232Z","title":"StreamVLN: Streaming vision-and- language navigation via SlowFast context modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16806","last_updated":"2026-07-18T12:55:40Z","snapshot_observed_at":"2026-08-07T06:25:42.181740Z","submitted_at":"2026-07-18T12:55:40Z","title":"Token-Wise Latent Streaming from Slow Reasoners to Fast Planners for Dynamic Vision Language Navigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T19:56:51.921232Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.16806"},"observation_digest":"sha256:c09809dfcd448371f13cac1e99369a73be80787ac38f0646b1f85fc1376055b4","observation_id":"e02f8ffc-b5f8-44a5-9f3e-ad1db1649f85","resolution":{"observed_at":"2026-08-01T19:56:51.921232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-08-01T16:20:01.321694Z","title":"Streamvln: Streaming vision-and-language navigation via slowfast context modeling.arXiv preprint arXiv:2507.05240,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18042","last_updated":"2026-07-23T15:59:17Z","snapshot_observed_at":"2026-08-07T04:23:36.775322Z","submitted_at":"2026-07-20T15:11:46Z","title":"Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T16:20:01.321694Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.18042"},"observation_digest":"sha256:5bbcf40c8ea1451b151cb9b507191d8b7ac12df87e414e8251be78f75351fb9c","observation_id":"5d51fa7c-e599-4faf-b223-5cb276df9a49","resolution":{"observed_at":"2026-08-01T16:20:01.321694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-08-01T12:04:39.750456Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19695","last_updated":"2026-07-22T02:53:46Z","snapshot_observed_at":"2026-08-02T17:57:13.937840Z","submitted_at":"2026-07-22T02:53:46Z","title":"NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T12:04:39.750456Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.19695"},"observation_digest":"sha256:ea16b52a7642ae98f07b1bcb011b28d1e57ac5640558703559dd04e165ae7b3c","observation_id":"7a4571ea-6daf-46cb-a412-8ac04f682ce0","resolution":{"observed_at":"2026-08-01T12:04:39.750456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-08-01T11:00:24.818615Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20061","last_updated":"2026-07-22T12:05:13Z","snapshot_observed_at":"2026-08-06T16:01:15.346277Z","submitted_at":"2026-07-22T12:05:13Z","title":"ReferTrack: Referring Then Tracking for Embodied Visual Tracking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T11:00:24.818615Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.20061"},"observation_digest":"sha256:f4e0a98bce874adbd4562ee7f93ebdca069dc0540fbfd382bb925843684e59f4","observation_id":"155c7167-7f48-4ec5-9a83-bbcf0dfb6a7c","resolution":{"observed_at":"2026-08-01T11:00:24.818615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-30T20:42:04.312697Z","title":"Streamvln: Streaming vision-and-language navigation via slowfast context modeling.arXiv preprint arXiv:2507.05240, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23504","last_updated":"2026-07-26T07:08:30Z","snapshot_observed_at":"2026-08-02T14:42:12.170166Z","submitted_at":"2026-07-26T07:08:30Z","title":"MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-30T20:42:04.312697Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.23504"},"observation_digest":"sha256:89faf8c89ef909e7a44672d6653c1e160c2201b48accaf1de6703e97390baffa","observation_id":"5bd1de4b-18ff-4341-9a0f-39851b05a53f","resolution":{"observed_at":"2026-07-30T20:42:04.312697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-08-01T00:43:26.897230Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26148","last_updated":"2026-08-03T01:02:45Z","snapshot_observed_at":"2026-08-06T23:24:51.965436Z","submitted_at":"2026-07-28T18:00:34Z","title":"Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T00:43:26.897230Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.26148"},"observation_digest":"sha256:2bc1f49975c7c757f024829b6335d316f69aff09a81ecbe03f3cb7e804d665a9","observation_id":"0241c4c3-f28b-4c6f-adfc-235710884803","resolution":{"observed_at":"2026-08-01T00:43:26.897230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-08-04T03:24:24.621076Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26148","last_updated":"2026-08-03T01:02:45Z","snapshot_observed_at":"2026-08-06T23:24:51.965436Z","submitted_at":"2026-07-28T18:00:34Z","title":"Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T03:24:24.621076Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.26148"},"observation_digest":"sha256:707079c799eed2b530ccb2ab940eb421a588843eefd40bd8cd21c116fe38a609","observation_id":"5a68a9fb-37e5-4bcc-a0fd-ab2db8827977","resolution":{"observed_at":"2026-08-04T03:24:24.621076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-08-06T00:31:40.601037Z","title":"Xie, Y.; He, B.; Wang, J.; Zheng, X.; Ye, Z.; and Wu, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01169","last_updated":"2026-08-02T11:44:51Z","snapshot_observed_at":"2026-08-06T23:25:48.845502Z","submitted_at":"2026-08-02T11:44:51Z","title":"Think in Sets for Streaming Video Token Compression","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T00:31:40.601037Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2608.01169"},"observation_digest":"sha256:6eaa08df8c552c0e7f1bf54611652916407834612607714675ff387f9782d492","observation_id":"e8cc92f2-e08c-48c4-a469-0c38834bf70e","resolution":{"observed_at":"2026-08-06T00:31:40.601037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.05240/citation-record","integrity":"/paper/2507.05240/integrity","json":"/paper/2507.05240/citation-record.json","paper":"/paper/2507.05240"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:07.219960Z","title":null,"venue":null,"work_id":"1974b455-48a6-483e-95ff-dd29c49a666d","year":2024},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:04.300000Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:aecc55fc18cb262f96a274e4f9dc0f22569bb291e7fae389ceb12b59c6191113","observation_id":"a1a6ac6b-8bb6-48fb-89a0-709f99a47467","resolution":{"observed_at":"2026-08-06T19:37:07.223688Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:07.206448Z","title":"Zhang, K","venue":null,"work_id":"ed768434-d45d-4596-9caa-a99b0ab02d01","year":2024},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:04.451288Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:ce9f7936775aea59b9dcc6a335c5123ca0d45161a0b1f14c3284eb7f7f3fe3c7","observation_id":"6541ff71-3000-4d95-8b2f-ac2d56703970","resolution":{"observed_at":"2026-08-06T19:37:07.210933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:07.193893Z","title":"Zhang, K","venue":null,"work_id":"fa02ccf1-ba26-4529-a07d-968b3b4898cc","year":2025},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:04.485778Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:7d5dde490bca562e140963a38aedc917bc95323019580407593659a2ce8d688e","observation_id":"d8ab1ff1-3102-4214-9e23-0689b4146f99","resolution":{"observed_at":"2026-08-06T19:37:07.197826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:07.181310Z","title":"Cheng, Y","venue":null,"work_id":"7f99a285-56a1-4107-ac0b-e3685918c0fc","year":2025},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:04.590753Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:1a8bd7c77b59198d2b3fa0211e0583597b72e8f52b4ce278bdace8f168792cd8","observation_id":"bd0a7da3-29dc-46f1-b4ae-dbdcdbb2ae70","resolution":{"observed_at":"2026-08-06T19:37:07.185208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13451","last_updated":"2026-05-09T11:40:06Z","snapshot_observed_at":"2026-08-02T06:35:33.765328Z","submitted_at":"2025-02-19T05:52:34Z","title":"MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13451","snapshot_observed_at":"2026-08-06T19:37:04.732234Z","title":"Zhang, X","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:04.732234Z"},"links":{"cited_paper":"/paper/2502.13451","citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:b428aa42a0154108aadc47d9583cedb1094f5b61d4d05e3a9cca7e5945a168ad","observation_id":"09fa0006-9fc2-46eb-a32f-6ff7111d3bf4","resolution":{"observed_at":"2026-08-06T19:37:04.732234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:07.168677Z","title":"Anderson, Q","venue":null,"work_id":"ce5c54b5-211d-4fb1-ac39-aac9925d860e","year":2018},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:04.950494Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:b6a5e6e033ff317befa883281ce2cb124c4c1368649af77884cb39974ac82e58","observation_id":"72e2793a-74b2-4fd8-a31f-1ae78d54c75b","resolution":{"observed_at":"2026-08-06T19:37:07.172347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-07-06T10:04:55.122236Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-06T19:37:05.110483Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:05.110483Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:b7bdfacfdb37ef2327434d83da33411b7e15bff6d01b1881a0bc908b8ce927c7","observation_id":"c253d784-c227-4c25-b950-f10c9c8ce7cd","resolution":{"observed_at":"2026-08-06T19:37:05.110483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:07.155784Z","title":"Chen, P.-L","venue":null,"work_id":"ccebfe1b-0762-46a2-a6f3-2dcd8f718096","year":2021},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:05.226968Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:bc4a8c216b6f5a47a80f171958b27e64624fafe5e4d0a43a568625e65badee7a","observation_id":"e55fc85a-52af-4434-9ccb-1b5815afd79a","resolution":{"observed_at":"2026-08-06T19:37:07.159661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:07.142754Z","title":"Chen, P.-L","venue":null,"work_id":"b121ef28-5a6e-450c-8eb1-939ca74478b0","year":2022},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:05.357839Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:443465f00eafb1a76d7e806147f867b7be1337d5346f7c5f007e771f00afa7ff","observation_id":"47ced714-6e49-4960-8ae1-df75802caca0","resolution":{"observed_at":"2026-08-06T19:37:07.146748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:07.128943Z","title":null,"venue":null,"work_id":"2f037b35-084c-4c98-bce5-5d5d21f97930","year":2021},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:05.600830Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:dfe56e205b41aaf76685ca60d9487365633c9bd88db716c6a88ca07e77bbe90b","observation_id":"bd239d17-36cb-499b-988f-b31536916bd2","resolution":{"observed_at":"2026-08-06T19:37:07.133373Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16986","last_updated":"2023-10-19T17:59:43Z","snapshot_observed_at":"2026-07-06T15:33:57.659685Z","submitted_at":"2023-05-26T14:41:06Z","title":"NavGPT: Explicit Reasoning in Vision-and-Language Navigation with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16986","snapshot_observed_at":"2026-08-06T19:37:05.744748Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:05.744748Z"},"links":{"cited_paper":"/paper/2305.16986","citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:a96390cdbd65e87c8ca0ea48097b4c3b7e1eb6f0cc27bd951bc2282726431dc1","observation_id":"c91a7d8e-19bf-4711-9c03-293b3c2b4026","resolution":{"observed_at":"2026-08-06T19:37:05.744748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.15207","last_updated":"2021-09-30T15:28:24Z","snapshot_observed_at":"2026-08-06T17:31:52.241672Z","submitted_at":"2021-09-30T15:28:24Z","title":"Language-Aligned Waypoint (LAW) Supervision for Vision-and-Language Navigation in Continuous Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.15207","snapshot_observed_at":"2026-08-06T19:37:05.891661Z","title":"Raychaudhuri, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:05.891661Z"},"links":{"cited_paper":"/paper/2109.15207","citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:39603e99b055744d8481984b05f0e43c8e12308821b94a635c89e029033f7651","observation_id":"8baa8afb-764b-49e8-a832-da8750fd07b4","resolution":{"observed_at":"2026-08-06T19:37:05.891661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:07.115955Z","title":"Georgakis, K","venue":null,"work_id":"86139eee-3b4e-4307-aa51-af878f1709df","year":2022},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:05.982383Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:0679eddfff7271c7c38dcaea6174774f9974a18b79bbc256107a433b213cf996","observation_id":"c78712a0-9dfe-4b68-b2e1-6b2f29e90d6c","resolution":{"observed_at":"2026-08-06T19:37:07.119892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07506","last_updated":"2022-10-14T04:23:27Z","snapshot_observed_at":"2026-07-06T14:05:06.502938Z","submitted_at":"2022-10-14T04:23:27Z","title":"Weakly-Supervised Multi-Granularity Map Learning for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07506","snapshot_observed_at":"2026-08-06T19:37:06.054748Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.054748Z"},"links":{"cited_paper":"/paper/2210.07506","citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:34605fa4b43d9b95f231c2b6e0fe206c6ae69fff309dc59b25f8655c6829d941","observation_id":"c5a8b931-cc68-43f9-8a96-7026892daff9","resolution":{"observed_at":"2026-08-06T19:37:06.054748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03047","last_updated":"2024-01-22T04:57:32Z","snapshot_observed_at":"2026-07-06T15:12:57.672390Z","submitted_at":"2023-04-06T13:07:17Z","title":"ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03047","snapshot_observed_at":"2026-08-06T19:37:06.202497Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.202497Z"},"links":{"cited_paper":"/paper/2304.03047","citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:db0c758e6f14fbdeff65b3048cd49cbb837525e40fae20ddd0d97cc4fa1aed64","observation_id":"25ee39d9-2525-4f94-89b5-442d9682cb04","resolution":{"observed_at":"2026-08-06T19:37:06.202497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:07.102986Z","title":null,"venue":null,"work_id":"eda7d5b8-5132-4545-978c-0786a5772fbe","year":2023},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.360697Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:72dd16563e4d28a51a806d3b5c7c6b211cead6449415fe39db06b151caf647c3","observation_id":"59db7e1b-557f-41af-a63f-7e4b1a083fa3","resolution":{"observed_at":"2026-08-06T19:37:07.107134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:07.089604Z","title":"Krantz, E","venue":null,"work_id":"b90cf76c-bc30-433e-8714-3e50c74c6c8c","year":2020},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.399558Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:30db9bf34e6e986b34d3e2b891e63b7ddb1c1e66bd6702b715e084ece08bf113","observation_id":"5fd12fe7-dcab-45d2-b277-06025467a4f8","resolution":{"observed_at":"2026-08-06T19:37:07.093534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:07.076920Z","title":null,"venue":null,"work_id":"96286f83-45fd-4786-8f14-6e957f500de7","year":2023},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.404949Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:1ed4f760ee84994ba6aca9496c2f69c06ac13ce1a1c7d1c0c765bd4bf4c30ba7","observation_id":"a4fca432-dfc3-49f0-9d7c-0d54cb817fe3","resolution":{"observed_at":"2026-08-06T19:37:07.081039Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:07.063675Z","title":null,"venue":null,"work_id":"c1dea21e-4e2f-417b-87e7-c5223cd9b662","year":2024},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.410064Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:606e3552bede8708e4313c4f7d140d358a1953a9b6748f025a7db07c3dceeccd","observation_id":"fb5b9c73-7622-40dc-9f13-d8c9e064af3e","resolution":{"observed_at":"2026-08-06T19:37:07.067772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11382","last_updated":"2023-09-20T15:04:49Z","snapshot_observed_at":"2026-07-06T16:21:17.180009Z","submitted_at":"2023-09-20T15:04:49Z","title":"Discuss Before Moving: Visual Language Navigation via Multi-expert Discussions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11382","snapshot_observed_at":"2026-08-06T19:37:06.415188Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.415188Z"},"links":{"cited_paper":"/paper/2309.11382","citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:e41b6e7a768827ab060436a0a63e7738b947b71b1296041001386e3a89b7f872","observation_id":"4f84e770-f257-4bd1-a943-4b38c6ce019d","resolution":{"observed_at":"2026-08-06T19:37:06.415188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07997","last_updated":"2023-08-15T19:01:19Z","snapshot_observed_at":"2026-08-06T03:03:10.665669Z","submitted_at":"2023-08-15T19:01:19Z","title":"$A^2$Nav: Action-Aware Zero-Shot Robot Navigation by Exploiting Vision-and-Language Ability of Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07997","snapshot_observed_at":"2026-08-06T19:37:06.419946Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.419946Z"},"links":{"cited_paper":"/paper/2308.07997","citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:aac705766d33584610adb87150f54b9803e485789a5a4b0af46044754d0df695","observation_id":"7320402f-b533-4006-9ce7-6023d1c394ab","resolution":{"observed_at":"2026-08-06T19:37:06.419946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04882","last_updated":"2024-06-07T12:26:34Z","snapshot_observed_at":"2026-08-07T05:10:17.561481Z","submitted_at":"2024-06-07T12:26:34Z","title":"InstructNav: Zero-shot System for Generic Instruction Navigation in Unexplored Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04882","snapshot_observed_at":"2026-08-06T19:37:06.424089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.424089Z"},"links":{"cited_paper":"/paper/2406.04882","citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:e05db2675aa850519b2b458d787a39278a44b98927491107f24cccd16ab03af6","observation_id":"b8e208ea-9c08-4139-bbb5-6828d2db7628","resolution":{"observed_at":"2026-08-06T19:37:06.424089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:07.051095Z","title":null,"venue":null,"work_id":"b5001784-1bae-4a79-9c64-ab480a61f1c0","year":2024},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.428506Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:270e9c7ef8b835e1b8bfdb6121e7ce0560a0ced19904f739148dbb0e58a0aaf4","observation_id":"a4aba587-729e-4d5c-bdcb-2de995417c69","resolution":{"observed_at":"2026-08-06T19:37:07.054767Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:07.038374Z","title":"Chang, A","venue":null,"work_id":"dd7c0265-7968-41b3-8686-2141ae5aa135","year":2017},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.432342Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:c1f7a4b8e8509bd95012857d78051e7c05513c879d560b01cf7f2480029b7883","observation_id":"5a93a66b-de4a-4294-a7cd-492059cc3678","resolution":{"observed_at":"2026-08-06T19:37:07.042373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:07.025529Z","title":null,"venue":null,"work_id":"0cea2311-e6f1-4e14-be45-8c8735fc704a","year":2019},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.436696Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:ebc1eff34c925103e0c436c176d82c279f81884ce14a8f535ccf04f875996e2c","observation_id":"4c8b3b58-0b5b-4be6-8eab-b55a3ff26e0e","resolution":{"observed_at":"2026-08-06T19:37:07.029428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08238","last_updated":"2021-09-16T22:01:24Z","snapshot_observed_at":"2026-07-06T11:48:35.206160Z","submitted_at":"2021-09-16T22:01:24Z","title":"Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08238","snapshot_observed_at":"2026-08-06T19:37:06.440919Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.440919Z"},"links":{"cited_paper":"/paper/2109.08238","citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:2d51a958a674c0f4a9838a39a6d637f2c666c02946bc796ee80a9ed0d6ec3e2c","observation_id":"69579633-7b64-4fe9-85cb-b9a9a3bd7d20","resolution":{"observed_at":"2026-08-06T19:37:06.440919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:07.012747Z","title":null,"venue":null,"work_id":"17e29a45-6a5d-40cf-b368-0358290eac6e","year":2011},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.445428Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:10a1d25120e0ad6e9f215e74bd630a94e7d8e93ece5440d4fe7bb886acc3df39","observation_id":"8397d883-9741-4e98-b261-c1d90d60b90f","resolution":{"observed_at":"2026-08-06T19:37:07.016919Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T19:37:06.449859Z","title":"Zhang, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.449859Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:66cf5cf4bba001ff20039732ae60f06dea479f0e62e238d99bc8cf806c5e7550","observation_id":"f86124a1-b5ac-4052-a9e4-c56c69400990","resolution":{"observed_at":"2026-08-06T19:37:06.449859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:06.999794Z","title":"Azuma, T","venue":null,"work_id":"fed843cd-2ac1-48a1-94b2-08286983ae6f","year":2022},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.453764Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:25a4b3c197dbb61d9e774a89c79fb4c83b03517c73053cd0c05fed7407cf725e","observation_id":"ebf53f03-e662-4614-8813-84e80b6c4ada","resolution":{"observed_at":"2026-08-06T19:37:07.003856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06939","last_updated":"2023-10-28T04:19:41Z","snapshot_observed_at":"2026-07-06T15:15:39.104303Z","submitted_at":"2023-04-14T06:17:46Z","title":"Multimodal C4: An Open, Billion-scale Corpus of Images Interleaved with Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06939","snapshot_observed_at":"2026-08-06T19:37:06.458067Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.458067Z"},"links":{"cited_paper":"/paper/2304.06939","citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:0c457d2f723f297b54bb24a6722cad78009dec6f5bd68f54bf698a5963ff233b","observation_id":"f7ca8001-b5f3-4738-bb41-372f06b969e9","resolution":{"observed_at":"2026-08-06T19:37:06.458067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T19:37:06.462400Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.462400Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:38480922695ce10b34cb536a77c74b3575f08d4f228b265ca8d57e964abb775d","observation_id":"eb6eac91-2bc6-4252-84fd-0a0a7a3ccc65","resolution":{"observed_at":"2026-08-06T19:37:06.462400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:06.987115Z","title":"Krantz, A","venue":null,"work_id":"a1b5c5cd-4a2d-42a4-86f8-cacad7257088","year":2021},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.466678Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:93ead1fe87d2bb7d1d69968ee9366558d4ee3fa21caed8e06e3791fca4a0561f","observation_id":"18acfa32-a0b2-432c-9294-f0599be06795","resolution":{"observed_at":"2026-08-06T19:37:06.991080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:06.974628Z","title":null,"venue":null,"work_id":"f5148f61-8e1a-472e-9fad-3fecb0c9f4bf","year":2022},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.470509Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:e77f1261925054bd19ee95e985b557b6d6bdec801285f895750085f20d5c6f6d","observation_id":"a0e04274-257d-4e3f-b352-7784d23846cf","resolution":{"observed_at":"2026-08-06T19:37:06.978424Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:06.960256Z","title":"Krantz and S","venue":null,"work_id":"dc2bc388-ba09-45be-bf93-5c0bc873cb98","year":2022},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.474563Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:a26d198a0878c10445b3703a55e2812979ce5d179d55957cffc05e36bbba91a1","observation_id":"e8e866ee-2d88-49dc-b40e-8dbad80f2a30","resolution":{"observed_at":"2026-08-06T19:37:06.964538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:06.946625Z","title":null,"venue":null,"work_id":"b98e1293-beba-42c4-8189-18b0e1584eb5","year":2023},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.478494Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:ca5d60ce7fe0f91c2501bf265a048b88a1255991ff2885ab7b1516e08c3b3356","observation_id":"76387e02-7a57-4976-8f3a-6bb42d3bbf30","resolution":{"observed_at":"2026-08-06T19:37:06.951187Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:06.933319Z","title":null,"venue":null,"work_id":"5fe1ae42-c540-4e9a-a58f-a84c88edb0cd","year":2021},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.482477Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:211299c2c21a9469bc25e6340be03c43105d5497d886a4409abb7ed760dc9a74","observation_id":"5dc7463b-a2d4-48bb-91eb-e05ab46f3b27","resolution":{"observed_at":"2026-08-06T19:37:06.937696Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09798","last_updated":"2024-10-14T04:48:18Z","snapshot_observed_at":"2026-07-06T18:30:50.693663Z","submitted_at":"2024-06-14T07:50:09Z","title":"Sim-to-Real Transfer via 3D Feature Fields for Vision-and-Language Navigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09798","snapshot_observed_at":"2026-08-06T19:37:06.486394Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.486394Z"},"links":{"cited_paper":"/paper/2406.09798","citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:1a2e05babf8d23708df590ac51a5e3cb89a48764e50d805f2bc577ec53426219","observation_id":"bde7ccd3-c346-4362-900d-b5355b079ea7","resolution":{"observed_at":"2026-08-06T19:37:06.486394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:06.919480Z","title":"Krantz, E","venue":null,"work_id":"561ea7e9-2b44-4007-85e4-d417d7474241","year":2020},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.490394Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:c016dd9b8b4b87791fb5c15dadb46aa59d49d731f8a861877b7c21ecd0d3a69a","observation_id":"a883a61c-328e-4ccd-a7d9-b87b7e9eee6d","resolution":{"observed_at":"2026-08-06T19:37:06.923597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:06.906703Z","title":null,"venue":null,"work_id":"5c0a6fbe-c264-4ddc-b467-6434993cd04b","year":2019},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.494300Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:3a39271d78f0ff283bed2d6d3e6a44eaf6a9b51187d1882f27b3697c7d320163","observation_id":"a8ff1c39-a971-4b8d-8343-8f85472aeb0f","resolution":{"observed_at":"2026-08-06T19:37:06.910528Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:06.892259Z","title":null,"venue":null,"work_id":"c0c5fbd2-9d39-4e58-bd54-5b10e71921c4","year":2023},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.498008Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:7a2bb8160eb458c29e2815c20d3fa90f6f688b4c07f2325fefc4826172d8af57","observation_id":"63d8b9eb-6a4d-4eda-96a0-45a75d1b920e","resolution":{"observed_at":"2026-08-06T19:37:06.897004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:06.877831Z","title":null,"venue":null,"work_id":"0d72ad0a-5a2a-419b-be80-49c51b78fdd6","year":2023},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.501769Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:6a3410f5117dec5a7c18a935e5121fb0cb3f30a153f5aebd4e8519eb9a0a9618","observation_id":"8b2c080d-c8e8-409e-b21f-55da58bc9b73","resolution":{"observed_at":"2026-08-06T19:37:06.882131Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-06T19:37:06.505642Z","title":"Huang, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.505642Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:6059a4f7ab634509b28b8ae8e73c3359e8835051402588b5081b3e0ce72409ba","observation_id":"5161b1a4-7d3b-4786-bfc1-00d966709b5a","resolution":{"observed_at":"2026-08-06T19:37:06.505642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-07T17:07:05.445620Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-06T19:37:06.509669Z","title":"Huang, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.509669Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:f48dfa4319fb7eae85143e51625f739a06186ae0ea442ae5a9a55cdd3c50583f","observation_id":"88a6554e-19af-47e0-8da7-d9bf491cdb57","resolution":{"observed_at":"2026-08-06T19:37:06.509669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-06T11:39:56.281668Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-06T19:37:06.513506Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.513506Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:df37d0947c595e93bb035052af147628913a5a8dbb9e8d3f5d68d267d04a3b22","observation_id":"8cb2eccc-24b5-42f7-a119-9f2e977d26ab","resolution":{"observed_at":"2026-08-06T19:37:06.513506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:06.864072Z","title":"Zheng, S","venue":null,"work_id":"ea096577-8b98-4856-b529-500161a44020","year":2024},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.518184Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:93366121a3dff3fbc89640d05a635f0369672cc8bfb2717e3ec0915eb48abaf2","observation_id":"840b945b-14ad-4537-8da6-ce1e8e4e14f0","resolution":{"observed_at":"2026-08-06T19:37:06.868293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:06.849337Z","title":null,"venue":null,"work_id":"595c8f18-4ae1-4527-a518-39ec39dcf2f4","year":2023},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.522164Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:1665bd19939448a4ea454ba2533738f53d915ae1a606d40c5ac4add64fd8e3c9","observation_id":"a8c54734-3622-487b-a795-2e0dfe7eaba8","resolution":{"observed_at":"2026-08-06T19:37:06.853571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13166","last_updated":"2023-07-06T06:25:33Z","snapshot_observed_at":"2026-08-06T05:49:07.078595Z","submitted_at":"2023-01-30T18:37:32Z","title":"ESC: Exploration with Soft Commonsense Constraints for Zero-shot Object Navigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13166","snapshot_observed_at":"2026-08-06T19:37:06.526119Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.526119Z"},"links":{"cited_paper":"/paper/2301.13166","citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:6eea271b3aabacc52e1cc440d684e54b55c8412d14df576fa9f2804dbed5e35b","observation_id":"265d71aa-7a0b-4165-86b6-a9ed00351bdc","resolution":{"observed_at":"2026-08-06T19:37:06.526119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:06.836793Z","title":null,"venue":null,"work_id":"18d35864-609f-4dd7-af50-800ece1174ee","year":2024},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.530512Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:0fca227e6b069077c47ab7120fe7bf57fa3211ab150534306c190a31f91e48bb","observation_id":"201e26d8-a14d-4ac7-a3df-150ddb500020","resolution":{"observed_at":"2026-08-06T19:37:06.840670Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:37:06.821873Z","title":"move forward 25 cm,","venue":null,"work_id":"030dfc24-bba2-474f-a527-2e661f0d7b9e","year":2024},"citing_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:06.534556Z"},"links":{"citing_paper":"/paper/2507.05240"},"observation_digest":"sha256:838328c91fb28a181a17b2a76d4a41f643a18ec44f4159313745df0bc89ccc12","observation_id":"34c73bbf-3223-4720-a970-82b31b304232","resolution":{"observed_at":"2026-08-06T19:37:06.827433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T19:26:50.907830Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 54 inbound Pith citation observations for arXiv:2507.05240."}