{"as_of":"2026-08-05T17:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ced880231d1981099ef3a1f352a17f39d087d733bb53665519ecf98b9bb26d5c","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T03:26:19.198670Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23181/citation-record","integrity":"/paper/2607.23181/integrity","json":"/paper/2607.23181/citation-record.json","paper":"/paper/2607.23181"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:12.181242Z","title":"Aligning cyber space with physical world: A comprehensive survey on embodied ai,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:12.181242Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:b3d366338977d156852a099f35dcbcb1c9d6abfab21df55ca1b749ca3dce4537","observation_id":"1543a9b6-d811-4830-8b25-842e710e9c9b","resolution":{"observed_at":"2026-08-01T03:26:12.181242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02385","last_updated":"2024-02-04T07:55:01Z","snapshot_observed_at":"2026-08-04T15:45:08.679135Z","submitted_at":"2024-02-04T07:55:01Z","title":"A Survey on Robotics with Foundation Models: toward Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02385","snapshot_observed_at":"2026-08-01T03:26:12.242060Z","title":"A survey on robotics with foundation models: toward embodied ai,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:12.242060Z"},"links":{"cited_paper":"/paper/2402.02385","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:b37bab8f674ba003c23a42956a5e5e7cedf755c078ced188dc3edff842ba67be","observation_id":"dad256b8-f2ec-4a80-8955-165b6e4720e1","resolution":{"observed_at":"2026-08-01T03:26:12.242060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:12.356671Z","title":"Beyond the nav-graph: Vision and language navigation in continuous environments,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:12.356671Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:af5bacfd648b9b5f06d08402d57d0ab5f542ac3b35609cd1497a68b4b66c23b4","observation_id":"e0e1dfde-c087-432b-8f6d-f7777281eea5","resolution":{"observed_at":"2026-08-01T03:26:12.356671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:12.435438Z","title":"Bridging the gap between learning in discrete and continuous en- vironments for vision-and-language navigation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:12.435438Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:3984d9b71ea850cef4370d40bb717bc0502dd6d99cbe7fad22d2511e3b7e0bd6","observation_id":"a6a320fc-374d-41f0-b2ef-1cd372d368dd","resolution":{"observed_at":"2026-08-01T03:26:12.435438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06158","last_updated":"2017-09-18T20:34:48Z","snapshot_observed_at":"2026-08-02T16:47:23.623541Z","submitted_at":"2017-09-18T20:34:48Z","title":"Matterport3D: Learning from RGB-D Data in Indoor Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.06158","snapshot_observed_at":"2026-08-01T03:26:12.585421Z","title":"Matterport3d: Learning from rgb-d data in indoor environments,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:12.585421Z"},"links":{"cited_paper":"/paper/1709.06158","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:ebe360f71b4f35c5abb7c256f9ae8969e90c1cb6054f3501404d9fbabc91f656","observation_id":"9bff19d4-2fe1-418d-97eb-86d9b67621df","resolution":{"observed_at":"2026-08-01T03:26:12.585421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:12.714018Z","title":"Towards long-horizon vision-language navigation: Platform, benchmark and method,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:12.714018Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:4deb42f768683c5d327c52b1c40f83ad9eee8cc5043bef92f15bb70043064141","observation_id":"d3a2d63d-db1c-490c-9ed0-1c659ffe8fb6","resolution":{"observed_at":"2026-08-01T03:26:12.714018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:12.823905Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:12.823905Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:c5e23c5be065423e2c5b145bc469a6045f2b47a818a597abc72d3589dcf4abcc","observation_id":"f92ee1f3-9552-4f6f-a86b-babaeffd1511","resolution":{"observed_at":"2026-08-01T03:26:12.823905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14795","last_updated":"2022-03-15T22:37:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-30T17:53:34Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14795","snapshot_observed_at":"2026-08-01T03:26:12.987863Z","title":"Perceiver io: A general architecture for structured inputs & outputs,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:12.987863Z"},"links":{"cited_paper":"/paper/2107.14795","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:56a1d7d59a2703a9b8054e7a36fd12de55c53168e0f39ffe2e1023c0f2aab1a0","observation_id":"ae2e058f-32bc-4639-b2bc-ab9a4561dd83","resolution":{"observed_at":"2026-08-01T03:26:12.987863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:13.099845Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:13.099845Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:e2af8c59e4b9264d01d063febb9d3fd91d6ffcdb5f870259d4021cf3718d515b","observation_id":"cfa80771-e8bb-47b1-979e-308e94bc8a20","resolution":{"observed_at":"2026-08-01T03:26:13.099845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-07-06T21:31:15.898821Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20897","snapshot_observed_at":"2026-08-01T03:26:13.213780Z","title":"Cross from left to right brain: Adaptive text dreamer for vision-and-language navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:13.213780Z"},"links":{"cited_paper":"/paper/2505.20897","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:47461b097a83beb3a2b1216b6fa25b5f2b72e6d808d3253518c03b4152094257","observation_id":"92eb84c2-2bcd-48d2-b0b0-7014200d7bd7","resolution":{"observed_at":"2026-08-01T03:26:13.213780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:13.354966Z","title":"Span-nav: Generalized spatial awareness for versatile vision-language navigation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:13.354966Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:2d96df7a2536e69ef331b02816b19ca9c8eeda8ae046140ca500611ca9ef88ae","observation_id":"ecce2c54-2a46-4517-b5dc-6ba247e2a2ea","resolution":{"observed_at":"2026-08-01T03:26:13.354966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.27577","last_updated":"2026-08-01T10:28:12Z","snapshot_observed_at":"2026-08-05T16:16:31.937672Z","submitted_at":"2026-03-29T08:34:05Z","title":"Structured Observation Language for Efficient and Generalizable Vision-Language Navigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.27577","snapshot_observed_at":"2026-08-01T03:26:13.492892Z","title":"Structured observation language for efficient and generalizable vision-language navigation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:13.492892Z"},"links":{"cited_paper":"/paper/2603.27577","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:4d3c2c41c4ebf63e6795fcb93fcc08b9668c374420a270376ff20379fa19e6d6","observation_id":"c4480d23-03c6-4b56-8ccf-e2fd385735f8","resolution":{"observed_at":"2026-08-01T03:26:13.492892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:13.640270Z","title":"Navforesee: A unified vision-language world model for hierarchical planning and dual-horizon navigation prediction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:13.640270Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:799970861c12a0874b125ab0d12bdf762d08fb060a6fab5a82aeb0bcd020b5de","observation_id":"033cad07-65c0-4a57-b4ab-173e856692cf","resolution":{"observed_at":"2026-08-01T03:26:13.640270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:13.838016Z","title":"Mapdream: Task-driven map learning for vision-language navigation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:13.838016Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:934c8db70694c955cecb2f97ff43f540d145bdc701e7a959d316830475b9f107","observation_id":"36f748de-f012-4c69-85ab-0ec337fbda4e","resolution":{"observed_at":"2026-08-01T03:26:13.838016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:13.968141Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:13.968141Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:492c486905f04abe06f7d84e9192ca811201384e6a5c0ddd4610dad76948c340","observation_id":"a77e19a2-6188-49d3-bf39-d92c66494f74","resolution":{"observed_at":"2026-08-01T03:26:13.968141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:14.134079Z","title":"Room-across-room: Multilingual vision-and- language navigation with dense spatiotemporal grounding,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:14.134079Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:0c3afe5c5bd7a4982e522dd9a7524f0e4f5888ff457d956de2f817030c16d1ca","observation_id":"12ba6ac8-4c30-4505-a73f-5a78cd6c547d","resolution":{"observed_at":"2026-08-01T03:26:14.134079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:14.311905Z","title":"Cosmo: Combination of selective memorization for low-cost vision-and-language navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:14.311905Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:d5aa3b548bb9213d4e820b92aeb848b2802fcd548eca041baa4bfdf92efcdd57","observation_id":"af713ca6-51f8-4a43-bebd-0b40b56e6cc3","resolution":{"observed_at":"2026-08-01T03:26:14.311905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:14.452660Z","title":"3d gaussian map with open-set semantic grouping for vision-language navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:14.452660Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:22b9cb46fdc944382ad5ad517677195d7bf73583958e4c3211fe7eedf1e40394","observation_id":"d71e7220-74a9-4f08-b44e-16a5d8089a72","resolution":{"observed_at":"2026-08-01T03:26:14.452660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:14.669721Z","title":"Etpnav: Evolving topological planning for vision-language navigation in continuous environments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:14.669721Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:8393078cd74ee47d00047fd1f75665f314bb64720e664a77c0107de482c6b163","observation_id":"73b7b311-089d-4fc2-bd28-412dbbc65400","resolution":{"observed_at":"2026-08-01T03:26:14.669721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:14.811495Z","title":"Dreamwalker: Mental planning for continuous vision- language navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:14.811495Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:1fcabb58c4eeb9149ec6fcd62feaa148526f01e8b2dda9d952b7b83a6e908eb0","observation_id":"33b3d023-5eb4-4571-be07-19f7b42523a9","resolution":{"observed_at":"2026-08-01T03:26:14.811495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:14.949609Z","title":"Lookahead exploration with neural radiance representation for continuous vision-language navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:14.949609Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:863fadd6f5d084869a369054e5987f629879ee2bd28e84cee498ce22bd67d671","observation_id":"9280c9ef-0803-4978-a4bb-925df3a72173","resolution":{"observed_at":"2026-08-01T03:26:14.949609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:15.078012Z","title":"Navgpt: Explicit reasoning in vision-and-language navigation with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:15.078012Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:f8f5dbebd6bd02640f5dcead1987dcc49489893d421a94afd682f2c87a346c1c","observation_id":"e171ff47-c52f-4168-9b41-66264d09b133","resolution":{"observed_at":"2026-08-01T03:26:15.078012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-07-06T17:34:57.509162Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15852","snapshot_observed_at":"2026-08-01T03:26:15.215349Z","title":"Navid: Video-based vlm plans the next step for vision-and-language navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:15.215349Z"},"links":{"cited_paper":"/paper/2402.15852","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:ddb1db7a6dd790b29f8b5d5e66a7906ee6949af7bffc4f4b88682a28524cba0c","observation_id":"d602a1c9-fd03-4ada-853f-3883742f3fae","resolution":{"observed_at":"2026-08-01T03:26:15.215349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-07-06T20:03:42.903210Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06224","snapshot_observed_at":"2026-08-01T03:26:15.370486Z","title":"Uni-navid: A video-based vision-language-action model for unifying embodied navigation tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:15.370486Z"},"links":{"cited_paper":"/paper/2412.06224","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:d7c303e7290eb20c5078c207b6351a257e835d36251aa330fcadfa2eb341f2af","observation_id":"eb45f875-bba9-44ae-a15d-e832b434ccd8","resolution":{"observed_at":"2026-08-01T03:26:15.370486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17221","last_updated":"2025-06-25T06:03:22Z","snapshot_observed_at":"2026-08-03T03:06:06.303999Z","submitted_at":"2025-06-20T17:59:59Z","title":"VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17221","snapshot_observed_at":"2026-08-01T03:26:15.484911Z","title":"Vln-r1: Vision-language navigation via reinforcement fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:15.484911Z"},"links":{"cited_paper":"/paper/2506.17221","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:8caa99996100b111d9875dd818bd9ee5cd571a0dda7f65d6df5042244a9744a2","observation_id":"7b9be73c-fe2f-4bf4-b991-db29888e2848","resolution":{"observed_at":"2026-08-01T03:26:15.484911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-03T15:20:23.515607Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-01T03:26:15.562072Z","title":"Dream to control: Learning behaviors by latent imagination,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:15.562072Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:31450dcc0272cb77c9585c3a0c518b30ab4e595ac2d87bfecacf841ae9889a78","observation_id":"2324cbe7-691c-44d6-8364-5693e57377f0","resolution":{"observed_at":"2026-08-01T03:26:15.562072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:15.662143Z","title":"Learning latent dynamics for planning from pixels,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:15.662143Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:95a799bc205015351b8c33706beaed639b5c9e6aac47b2d7dbab133a832c98ec","observation_id":"4fcc13c2-3ca8-40ad-8f5f-589c8646421b","resolution":{"observed_at":"2026-08-01T03:26:15.662143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:15.764248Z","title":"Pathdreamer: A world model for indoor navigation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:15.764248Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:044e0dedfd6111cf4eed80b6e66c7a2dd4c363a0bbf56c618fcdcd58fe6007f9","observation_id":"265013e2-a883-48fc-ad83-7dcdd5c5c1bb","resolution":{"observed_at":"2026-08-01T03:26:15.764248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:15.859295Z","title":"Panogen: Text-conditioned panoramic environment generation for vision-and- language navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:15.859295Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:03a2154d24e9363a8abb15584d1040a395129b875f4864dc225938f5fe802b5a","observation_id":"86774cf2-987d-4613-9e14-a40661e47193","resolution":{"observed_at":"2026-08-01T03:26:15.859295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:15.934047Z","title":"Do visual imaginations improve vision-and-language navigation agents?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:15.934047Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:27d0482fa490ba40a422c6d48fb01b06dd34e0af5ad1c9129d2eed928be5b336","observation_id":"f991e654-ca05-425f-8ddf-aae835df3fe9","resolution":{"observed_at":"2026-08-01T03:26:15.934047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:16.018233Z","title":"Navmorph: A self-evolving world model for vision-and-language navigation in continuous environments,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:16.018233Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:9b3ba1ab31d7cd8bde701b0825bc5e3053f656462ab101f1686ce390c164b278","observation_id":"884692f4-cc5f-4464-add7-c58fb3609d2c","resolution":{"observed_at":"2026-08-01T03:26:16.018233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.11197","last_updated":"2025-09-14T09:54:20Z","snapshot_observed_at":"2026-08-04T17:00:42.809060Z","submitted_at":"2025-09-14T09:54:20Z","title":"DreamNav: A Trajectory-Based Imaginative Framework for Zero-Shot Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.11197","snapshot_observed_at":"2026-08-01T03:26:16.086989Z","title":"Dreamnav: A trajectory-based imaginative framework for zero-shot vision-and-language navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:16.086989Z"},"links":{"cited_paper":"/paper/2509.11197","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:6eb091cbab9051552336f9d408abe22b0177d7be583d182e695a3ba90f9cbefd","observation_id":"d2477e33-35cd-4bd7-8736-a9bb632fb8b2","resolution":{"observed_at":"2026-08-01T03:26:16.086989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:16.153246Z","title":"Navigation world models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:16.153246Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:3e4416f1fb826dde4f52c693d9cb6c539190ccfabf3fbdb9c206cf59fdfaa2d7","observation_id":"0d0b3b89-d582-4ff8-a181-719840c361dd","resolution":{"observed_at":"2026-08-01T03:26:16.153246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:16.256185Z","title":"The expression of a tensor or a polyadic as a sum of products,","venue":null,"work_id":null,"year":1927},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:16.256185Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:e82a152b8848dd906ce28e2498b668562e413ffa1f0aa8a2f1aad986870071cc","observation_id":"68d25112-d192-46bd-9340-03aeb4a6d3e1","resolution":{"observed_at":"2026-08-01T03:26:16.256185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:16.309801Z","title":"Some mathematical notes on three-mode factor analysis,","venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:16.309801Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:639c2f3dd60a70a70f10af266e358a31182957f3f4f0f5622a73cf62a256daee","observation_id":"169de0c5-32ff-4053-9a1c-023f9a84d16c","resolution":{"observed_at":"2026-08-01T03:26:16.309801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.03383","last_updated":"2016-11-10T16:24:16Z","snapshot_observed_at":"2026-07-06T05:18:09.847358Z","submitted_at":"2016-11-10T16:24:16Z","title":"Disentangling factors of variation in deep representations using adversarial training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.03383","snapshot_observed_at":"2026-08-01T03:26:16.377030Z","title":"Disentangling factors of variation in deep representations using adversarial training,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:16.377030Z"},"links":{"cited_paper":"/paper/1611.03383","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:b194759e77c9001575b54e0a0e77c7bbb1c76f891ce655232af489990759b603","observation_id":"67c74862-7d94-4424-b667-0e3cfc00d87f","resolution":{"observed_at":"2026-08-01T03:26:16.377030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:16.447675Z","title":"Hamiltonian latent operators for content and motion disentanglement in image sequences,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:16.447675Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:ac39316086fe39eac9ab63bd0104a95a58862fcc2c28a32201ff697190ee6256","observation_id":"b8d29965-615d-40a2-a8b2-b62f2a2c5835","resolution":{"observed_at":"2026-08-01T03:26:16.447675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:16.568902Z","title":"Iso-dream: Isolating and leveraging noncontrollable visual dynamics in world models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:16.568902Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:0f7067878a50435a30bee3fa67d5cb6c2c0763630edb16a70ed4e57f5ac8a6b6","observation_id":"a25656f3-e7e4-47e0-8793-70c27f10d831","resolution":{"observed_at":"2026-08-01T03:26:16.568902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18938","last_updated":"2025-06-02T14:37:52Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:58:15Z","title":"AdaWorld: Learning Adaptable World Models with Latent Actions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18938","snapshot_observed_at":"2026-08-01T03:26:16.735012Z","title":"Adaworld: Learning adaptable world models with latent actions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:16.735012Z"},"links":{"cited_paper":"/paper/2503.18938","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:1f92078181c79eb751271a0ee8adbdf4dc37d3dc16846bf4f2e6f8a053b2bae4","observation_id":"0fcc3d26-ca53-40db-b1a1-3a05098615ca","resolution":{"observed_at":"2026-08-01T03:26:16.735012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16229","last_updated":"2026-05-25T05:51:24Z","snapshot_observed_at":"2026-08-02T22:41:03.647765Z","submitted_at":"2026-02-18T07:08:14Z","title":"Factored Latent Action World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16229","snapshot_observed_at":"2026-08-01T03:26:16.890582Z","title":"Factored latent action world models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:16.890582Z"},"links":{"cited_paper":"/paper/2602.16229","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:22bce5ec5db530be63cbb1e68f5acce88a3164775e427e36c6ba8b0f32a93eaa","observation_id":"f2bcc129-7ad7-4880-82c5-ed3c0c899b53","resolution":{"observed_at":"2026-08-01T03:26:16.890582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:17.090795Z","title":"Compressing neural networks using the variational information bottleneck,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:17.090795Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:d53200cfc1549c5ba6cf71fb9ea4523ade135020c78bd696ed03e7b98749310e","observation_id":"df0c69d3-710d-43f7-b214-086d5db17f22","resolution":{"observed_at":"2026-08-01T03:26:17.090795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.06216","last_updated":"2018-04-19T12:10:32Z","snapshot_observed_at":"2026-07-06T06:33:52.149780Z","submitted_at":"2018-04-17T13:09:19Z","title":"Learning Sparse Latent Representations with the Deep Copula Information Bottleneck","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.06216","snapshot_observed_at":"2026-08-01T03:26:17.229949Z","title":"Learning sparse latent representations with the deep copula information bottleneck,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:17.229949Z"},"links":{"cited_paper":"/paper/1804.06216","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:b749968f7bafd9926d279badd274b0858f4fe01c2f09dbcc8b089c7b95094897","observation_id":"242e0bd2-5197-4123-9615-7d66c4892370","resolution":{"observed_at":"2026-08-01T03:26:17.229949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09902","last_updated":"2018-07-14T17:47:49Z","snapshot_observed_at":"2026-07-06T06:25:38.365833Z","submitted_at":"2018-02-13T04:24:49Z","title":"Attention-Based Guided Structured Sparsity of Deep Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.09902","snapshot_observed_at":"2026-08-01T03:26:17.387571Z","title":"Attention-based guided structured sparsity of deep neural networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:17.387571Z"},"links":{"cited_paper":"/paper/1802.09902","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:98042b779691e08be772e0f8667a67135c753cfaf3e1ab28fa650207c1de0830","observation_id":"2d91c6ef-cf2b-4dab-891f-340f62ead431","resolution":{"observed_at":"2026-08-01T03:26:17.387571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:17.503590Z","title":"Learning latent dynamic robust representations for world models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:17.503590Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:5457f2acfe14467462051f8f2f30e470c3370030e95449e7a33e3852c606d42d","observation_id":"6df6b89a-4594-4fa5-bdaa-e6038b864025","resolution":{"observed_at":"2026-08-01T03:26:17.503590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02853","last_updated":"2025-05-13T03:02:42Z","snapshot_observed_at":"2026-07-06T20:31:22.252573Z","submitted_at":"2025-02-05T03:13:04Z","title":"Rethinking Latent Redundancy in Behavior Cloning: An Information Bottleneck Approach for Robot Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02853","snapshot_observed_at":"2026-08-01T03:26:17.843603Z","title":"Rethinking latent redundancy in behavior cloning: An information bottleneck approach for robot manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:17.843603Z"},"links":{"cited_paper":"/paper/2502.02853","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:8aae35ee3b91b97084ff595333a91599f31eadaa7576a0c4a0fbe22b970b7b8d","observation_id":"6b4af7ba-75ed-4da6-a22d-74e9fcf1a821","resolution":{"observed_at":"2026-08-01T03:26:17.843603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:17.954779Z","title":"Enhanced structured lasso pruning with class-wise information,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:17.954779Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:dda4535dc1a66ad1802faea55829a4a18f2e8ca8e83cd5e06825301e0a4e860a","observation_id":"c518e69c-dbe0-4402-a81f-c67ff2897e50","resolution":{"observed_at":"2026-08-01T03:26:17.954779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:18.070503Z","title":"Object-centric learning with slot attention,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:18.070503Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:42112a58872e4292799584be10c74590e13728903d4bb2a4ca785fc220b71651","observation_id":"4281c3b9-4974-4963-b353-57acb2594cae","resolution":{"observed_at":"2026-08-01T03:26:18.070503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-01T03:26:18.152576Z","title":"Qwen2.5 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:18.152576Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:cb8437af870337213fb3e14d24abef02c80f137ede062b2e54013d0654c7d261","observation_id":"47d2cd77-f1d9-4740-bb0b-b1424a25cd08","resolution":{"observed_at":"2026-08-01T03:26:18.152576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:18.248349Z","title":"Tensor decompositions and applications,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:18.248349Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:90423d543903cdc694d67dff3873df16524a0194891b9f691b3de83c734c8b0d","observation_id":"70c3d765-cbc9-4994-a541-b81e096cfdd1","resolution":{"observed_at":"2026-08-01T03:26:18.248349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:18.353740Z","title":"Tensorizing neural networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:18.353740Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:649e536ac8cc8c29894cd466c0f304e9d5ac0d438b0d8a11dc95a915b3967473","observation_id":"5d1612b5-3e74-4084-9183-e3d8f1b719a5","resolution":{"observed_at":"2026-08-01T03:26:18.353740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.00410","last_updated":"2019-10-23T22:47:44Z","snapshot_observed_at":"2026-07-06T05:21:01.935928Z","submitted_at":"2016-12-01T20:12:40Z","title":"Deep Variational Information Bottleneck","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.00410","snapshot_observed_at":"2026-08-01T03:26:18.465247Z","title":"Deep variational information bottleneck,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:18.465247Z"},"links":{"cited_paper":"/paper/1612.00410","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:2c638ce426f6982d4f9720bce411e88b239a6b0d5b79cb31da05bb3b96914a24","observation_id":"c36c752a-67d2-42d8-8463-0ec33cb781b9","resolution":{"observed_at":"2026-08-01T03:26:18.465247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"physics/0004057","last_updated":"2000-04-24T15:22:30Z","snapshot_observed_at":"2026-07-07T06:44:19.645435Z","submitted_at":"2000-04-24T15:22:30Z","title":"The information bottleneck method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"physics/0004057","snapshot_observed_at":"2026-08-01T03:26:18.571987Z","title":"The information bottleneck method,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:18.571987Z"},"links":{"cited_paper":"/paper/physics/0004057","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:8a745e88be6d3b263c0a52de33c1f5e68c5d232c3478242c0663752d6f9ba428","observation_id":"9b199ddd-48a7-4b9a-b89d-45cdab281688","resolution":{"observed_at":"2026-08-01T03:26:18.571987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:18.690277Z","title":"Sim-2-sim transfer for vision-and-language navigation in continuous environments,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:18.690277Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:253c8e82c5d67b946ce32bfb4d41d9d58b453f1f1978e4161ab0d147817b213c","observation_id":"4d2e72bf-55e3-4d27-a68f-5ce0d0b2cd87","resolution":{"observed_at":"2026-08-01T03:26:18.690277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:18.769727Z","title":"Bridging the gap between learning in discrete and continuous environments for vision-and-language navigation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:18.769727Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:4d1d6b27595a2dded7ac44aef1005dd330bb40903bf246cb910bf2b57d90aada","observation_id":"6d708582-f21a-4849-891c-655cc7a777e9","resolution":{"observed_at":"2026-08-01T03:26:18.769727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:18.853036Z","title":"Dreamwalker: Mental planning for continuous vision- language navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:18.853036Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:b2fa6f19453ebf4f4b2a3da255e11de74c5ad1c7f7d17c939b283590409e0a75","observation_id":"6399b1a6-e056-4e40-b7f2-b4d8d0c40d10","resolution":{"observed_at":"2026-08-01T03:26:18.853036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:18.937944Z","title":"Gridmm: Grid memory map for vision-and-language navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:18.937944Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:32e3966cd4d21c5dd7e97fb1852e1f6c3f8b856ece2209f3c5673e022d2ce54d","observation_id":"b9c32144-3293-4884-9531-3e56639c8a79","resolution":{"observed_at":"2026-08-01T03:26:18.937944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04385","last_updated":"2023-08-03T09:39:00Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-08T16:27:54Z","title":"BEVBert: Multimodal Map Pre-training for Language-guided Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04385","snapshot_observed_at":"2026-08-01T03:26:19.022152Z","title":"Bevbert: Topo-metric map pre-training for language-guided navigation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:19.022152Z"},"links":{"cited_paper":"/paper/2212.04385","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:cc086b0461240aa107746788e0ad0532aed9c195f9037f0cad80c8bb4c553485","observation_id":"0899cc28-37fb-4e2e-b629-ba12eccde1ed","resolution":{"observed_at":"2026-08-01T03:26:19.022152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:19.104462Z","title":"Fast-slow test-time adaptation for online vision-and-language navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:19.104462Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:6fa25a2fde9a777b1e6ee167bdc2e96afa17d1a75377e40eaa73fef2953ec130","observation_id":"6c6208cd-036d-4790-8d12-6b73e3219350","resolution":{"observed_at":"2026-08-01T03:26:19.104462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:19.174228Z","title":"Language-aligned waypoint (law) supervi- sion for vision-and-language navigation in continuous environments,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:19.174228Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:a55da3e82279bc031f1812ac3fbf04d9690e55d8f11213926e459691915bdcd4","observation_id":"64ae8c9c-df64-4ef5-8433-a9de0d576f88","resolution":{"observed_at":"2026-08-01T03:26:19.174228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05890","last_updated":"2024-08-20T14:51:04Z","snapshot_observed_at":"2026-07-06T18:43:00.310399Z","submitted_at":"2024-07-08T12:52:46Z","title":"Affordances-Oriented Planning using Foundation Models for Continuous Vision-Language Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05890","snapshot_observed_at":"2026-08-01T03:26:19.178700Z","title":"Affordances-oriented planning using foundation models for continuous vision-language navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:19.178700Z"},"links":{"cited_paper":"/paper/2407.05890","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:f4bccdbb5be5fba0ef084a579e1562960206eaf2982c459fc91909fa86aaac77","observation_id":"06fad732-dd8d-492f-8382-863321962362","resolution":{"observed_at":"2026-08-01T03:26:19.178700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11610","last_updated":"2022-06-26T14:37:08Z","snapshot_observed_at":"2026-07-06T13:23:55.107856Z","submitted_at":"2022-06-23T10:36:53Z","title":"1st Place Solutions for RxR-Habitat Vision-and-Language Navigation Competition (CVPR 2022)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11610","snapshot_observed_at":"2026-08-01T03:26:19.181601Z","title":"1st place solutions for rxr-habitat vision-and-language navigation competition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:19.181601Z"},"links":{"cited_paper":"/paper/2206.11610","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:edee2bdafb0d973ba145a69a2409f2bdae913e1dba18749572ea095c5dbc16ad","observation_id":"ed6979da-f556-412c-9d42-8254340c37a0","resolution":{"observed_at":"2026-08-01T03:26:19.181601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.05446","last_updated":"2019-11-28T16:59:52Z","snapshot_observed_at":"2026-07-06T08:07:12.362127Z","submitted_at":"2019-07-11T18:42:03Z","title":"General Evaluation for Instruction Conditioned Navigation using Dynamic Time Warping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.05446","snapshot_observed_at":"2026-08-01T03:26:19.184355Z","title":"General evaluation for instruction conditioned navigation using dynamic time warping,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:19.184355Z"},"links":{"cited_paper":"/paper/1907.05446","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:19bd097a98a755807c83471cf060feddce90f8631278f2d5c3974e168316e5d0","observation_id":"4b85743e-5f66-48a6-add6-e28ff659a34b","resolution":{"observed_at":"2026-08-01T03:26:19.184355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-01T03:26:19.187322Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:19.187322Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:fe350863c2a86e6ce763caf0930361565addf43732a2c80c40b1102ffcf58ec7","observation_id":"47361b57-e13d-4e66-a05f-dfa6cbe76118","resolution":{"observed_at":"2026-08-01T03:26:19.187322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:19.190214Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:19.190214Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:3216931870ecf000a7d6a184528a60f4f807b765d7b5832e1b18ab28ddbf3d89","observation_id":"da64fecb-2b57-48df-9eec-ec34b719c643","resolution":{"observed_at":"2026-08-01T03:26:19.190214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:26:19.193062Z","title":"Cross- modal map learning for vision and language navigation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:19.193062Z"},"links":{"citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:05610b11ed7cd1009d1fae0628db87b5e6068751e9be42688bf60919954da370","observation_id":"b29a330f-ffce-496d-8f11-9737d92265cb","resolution":{"observed_at":"2026-08-01T03:26:19.193062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07490","last_updated":"2019-12-03T19:30:19Z","snapshot_observed_at":"2026-08-05T13:28:33.451106Z","submitted_at":"2019-08-20T17:05:18Z","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.07490","snapshot_observed_at":"2026-08-01T03:26:19.195676Z","title":"Lxmert: Learning cross-modality encoder representations from transformers,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:19.195676Z"},"links":{"cited_paper":"/paper/1908.07490","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:f694cc2d31bec45e4955b7b3f6eb6807dec26809fbd53f70586a027c0ea3dc19","observation_id":"d18b334d-af2e-4686-b0cb-9dd7153719b8","resolution":{"observed_at":"2026-08-01T03:26:19.195676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-01T03:26:19.198670Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:19.198670Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:5a332da3063c7187457c5c82e42b8b82ac17fe7c160bb6daf71b9748750677f9","observation_id":"9445d9d9-0ecb-4833-b8f5-612d81dfb01d","resolution":{"observed_at":"2026-08-01T03:26:19.198670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06263","last_updated":"2024-05-30T09:40:02Z","snapshot_observed_at":"2026-07-06T18:12:26.233112Z","submitted_at":"2024-05-10T06:28:42Z","title":"Learning Latent Dynamic Robust Representations for World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06263","snapshot_observed_at":"2026-08-01T03:26:17.714001Z","title":"Available: https://arxiv.org/abs/2405.06263","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T03:26:17.714001Z"},"links":{"cited_paper":"/paper/2405.06263","citing_paper":"/paper/2607.23181"},"observation_digest":"sha256:9410e6ab738c13de2b69d2fed3d38b96ac453d27ad2c6aea800d158ab4afe941","observation_id":"c87af2bf-3a10-4f05-83d5-2e3ae50a5259","resolution":{"observed_at":"2026-08-01T03:26:17.714001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23181","last_updated":"2026-07-25T12:26:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T19:10:00.194444Z","submitted_at":"2026-07-25T12:26:47Z","title":"Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":68,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2607.23181."}