Pith. sign in

Paper Citation Record · LEDGER

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation

As of 8 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 1 inbound Pith citation observation for arXiv:2505.16663.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.16663 v1

Coverage vector

measured 86 of 86 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:02:57.418588Z

measured 87 of 87 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-08T08:43:54.882467Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-11T20:31:12.651566Z

Reference resolution

86 of 86 outbound references displayed

  • verified exact0
  • verified fuzzy27
  • unresolved58
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 5459cc4b-f01f-431d-811e-70fa256f774c · outbound

This paper cites Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.185288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.185288Z digest=sha256:2694e05b2cdcebc4953d4e32ed32cd9f562938f3100a298ae33d2fe73cd8606f

Observation 6c700b45-057a-4f36-b138-e8092009fdce · outbound

This paper cites BEVBert: Multimodal Map Pre-training for Language-guided Navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation BEVBert: Multimodal Map Pre-training for Language-guided Navigation

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.260957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.260957Z digest=sha256:54a7c68cad73cf10364856792962cce784dceecaa588f315bb410ec5c501e69c

Observation 12a93b6a-2de0-4a3b-acf1-c122a90bddb8 · outbound

This paper cites On Evaluation of Embodied Navigation Agents.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation On Evaluation of Embodied Navigation Agents

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.314758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.314758Z digest=sha256:6c141524cd7b186bb1a99ac165635b462eb972355fcc4bb8085b70363995bec0

Observation 0c0f15c6-d55d-4869-ab98-77d9bdbd8d80 · outbound

This paper cites Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.344432Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.344432Z digest=sha256:b066395a535d6a786aeba6b074559045f9851a9b4f87ed0d0667fa6f9d764414

Observation 1c087e12-cdb5-48df-bb8d-3038b7c04819 · outbound

This paper cites Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.419818Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.419818Z digest=sha256:e33bdb29e3e8f0cb8acdbe2388959f5a16f8e96cc8b3d7847da5d3b2a9048945

Observation 269d6139-cfc6-4f78-92ba-cf68da220b74 · outbound

This paper cites Scanqa: 3d question answering for spatial scene understanding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Scanqa: 3d question answering for spatial scene understanding

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.497140Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.497140Z digest=sha256:eed9f5c531bfbe596608e761953aee8719338ad472c4dace870530c0e95e15f1

Observation 35418d20-2502-485e-a488-1c4afad4e2b0 · outbound

This paper cites Curriculum learning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Curriculum learning

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.571795Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.571795Z digest=sha256:070d5b41411af9499c1f605fb816e25811601a3ab8ab77f9d679d22b289f265c

Observation 803644f5-5be0-438a-80f2-527e9f4bd7e2 · outbound

This paper cites Coyo-700m: Image-text pair dataset.https://github.com/kakaobrain/coyo-dataset, 2022.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Coyo-700m: Image-text pair dataset.https://github.com/kakaobrain/coyo-dataset, 2022

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.621725Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.621725Z digest=sha256:b95777d00de6001b45c12a8f2f055a9469c575bdf4e9bd12684b0366bc6cd2e4

Observation 2b8ba055-c9ed-4467-9bd8-23b8b5020ee4 · outbound

This paper cites Matterport3D: Learning from RGB-D Data in Indoor Environments.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Matterport3D: Learning from RGB-D Data in Indoor Environments

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.671815Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.671815Z digest=sha256:9b6b48f14274a0e6e3b5a07228aa3bae8bb63b6353ca87e966d7321b22b064ef

Observation fca35d50-3a88-4a5c-97ec-fc333d96aade · outbound

This paper cites Conceptual 12M: Pushing web-scale image-text pre-training to recognize long-tail visual concepts.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Conceptual 12M: Pushing web-scale image-text pre-training to recognize long-tail visual concepts

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.739127Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.739127Z digest=sha256:5e0a42ad691e7e4082149bf7738f7a1ec577de0dd09b148f46f62bb35171e845

Observation 21515a60-5e7f-4b5e-a449-37f90ce34a6b · outbound

This paper cites Spatialvlm: Endowing vision-language models with spatial reasoning capabilities.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Spatialvlm: Endowing vision-language models with spatial reasoning capabilities

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.818855Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.818855Z digest=sha256:cb47a510af5c86f1c0cdb07a4a75950bfb3b13b7388ae3367019fc5f95dd0e01

Observation 2b0cfe7a-0f67-4cca-bc1d-f10d121e586e · outbound

This paper cites Scanrefer: 3d object localization in rgb-d scans using natural language.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Scanrefer: 3d object localization in rgb-d scans using natural language

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.889051Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.889051Z digest=sha256:6777f0d66801a854cb7c348853d44bd68f5508ca1feb69292628ead7a102aa82

Observation 6f2a2215-a244-4ee0-a580-1a532f346492 · outbound

This paper cites MapGPT: Map-Guided Prompting with Adaptive Path Planning for Vision-and-Language Navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation MapGPT: Map-Guided Prompting with Adaptive Path Planning for Vision-and-Language Navigation

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.924774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.924774Z digest=sha256:44545df08087fb8448e994d6119cb4d41e1adefafb0a4b576f1523dc1d36a6ce

Observation f7c8a17c-4d9a-43c2-adf4-dc0f4a8ade47 · outbound

This paper cites History aware multimodal transformer for vision-and-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation History aware multimodal transformer for vision-and-language navigation

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:03.991389Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:52.010081Z digest=sha256:9932a99d8fb4c0255d8e1ba7e7f9af554dc2e3a22e04e1adf7230ab286a9ef07

Observation b9f94454-ca63-4994-813e-df88e8cea3a0 · outbound

This paper cites Think global, act local: Dual-scale graph transformer for vision-and-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Think global, act local: Dual-scale graph transformer for vision-and-language navigation

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:03.844366Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:52.123638Z digest=sha256:42cb578b92e3de350aab7c5622a2650d7bafcc64cc612a1391344369a52f9596

Observation 1357fe32-c10f-44be-bd3b-b8bce7efd881 · outbound

This paper cites Microsoft COCO Captions: Data Collection and Evaluation Server.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Microsoft COCO Captions: Data Collection and Evaluation Server

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:52.215801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:52.215801Z digest=sha256:1518046b2a57dc34ceec6197dd5b6de3188d1ebd582bad0462bfad51ec0c0517

Observation c1477e4b-6647-4c5e-a97a-220f3527a3d4 · outbound

This paper cites Scan2cap: Context-aware dense captioning in rgb-d scans.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Scan2cap: Context-aware dense captioning in rgb-d scans

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:03.544182Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:52.260377Z digest=sha256:d3c0a2d2b1f410f37727d57846c3074e3b282483eab5370806907752245ff24b

Observation 293d8a3a-991d-4e9b-addf-4ada9f1f93d3 · outbound

This paper cites Gonzalez, Ion Stoica, and Eric P.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Gonzalez, Ion Stoica, and Eric P

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:52.408734Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:52.408734Z digest=sha256:db25f5801d2f73f5ccbea112c17727b3fa4dc40652e67bcd7ce7ba24dcb9d236

Observation 2a60419e-8b42-47bf-b579-7db8a7d0aba5 · outbound

This paper cites Objaverse: A universe of annotated 3d objects.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Objaverse: A universe of annotated 3d objects

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:03.197958Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:52.506412Z digest=sha256:a2e43e4ef89d04630ebb939f3b8756001039d1a3416f2c9a1c898fdb77a23ac3

Observation 34b713a6-811b-4cee-9c1b-c4b1df398b0a · outbound

This paper cites Imagenet: A large-scale hierarchical image database.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Imagenet: A large-scale hierarchical image database

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:52.588652Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:52.588652Z digest=sha256:fa9f713945efffe29ffad16edbe3abdd709f26156e1a8e6f8a88c611476c7b5e

Observation 01a671c2-f7c8-4748-8754-eabc42c1e184 · outbound

This paper cites Eva: Exploring the limits of masked visual representation learning at scale.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Eva: Exploring the limits of masked visual representation learning at scale

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:52.635057Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:52.635057Z digest=sha256:e3bc739d5f8811090987e467489ecbb892e172a91985bd67355b3c2001e13bfd

Observation 8f8c0a50-ba21-4e3a-bbcb-6f25178918bf · outbound

This paper cites 3d-front: 3d furnished rooms with layouts and semantics.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation 3d-front: 3d furnished rooms with layouts and semantics

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:02.930641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:52.741654Z digest=sha256:933dd7996ecdb7b3fb87c32049e7e0f1143cc132ec18e19f769377d95fc3607a

Observation c3e6fa09-42b1-48d6-a78b-9321040f646b · outbound

This paper cites Adaptive zone-aware hierarchical planner for vision-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Adaptive zone-aware hierarchical planner for vision-language navigation

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:02.636933Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:52.829184Z digest=sha256:9198d6b629a81931598f25d48a810d921ffe1ef82860ac122ecbd6d759851749

Observation 8a37d701-4536-4bbc-95f5-269a18e675c3 · outbound

This paper cites RoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied Navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation RoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied Navigation

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:52.927863Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:52.927863Z digest=sha256:4c7f6c04668a70b838e9e25ac2e1c2009e0e511aeb5beba1e94463917711f9e2

Observation 04d85396-d76d-4cc5-b220-5ce55cc2b4be · outbound

This paper cites Multimodal fusion and vision-language models: A survey for robot vision.arXiv preprint arXiv:2504.02477, 2025.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Multimodal fusion and vision-language models: A survey for robot vision.arXiv preprint arXiv:2504.02477, 2025

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:53.009496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:53.009496Z digest=sha256:f4ccc5f8fcd2aeaa422da46c0c6f79280ebb54b857a7121a1274e98b04883c13

Observation 7bb2342d-17dc-43eb-af21-240b2d6ea61a · outbound

This paper cites Towards learning a generic agent for vision-and-language navigation via pre-training.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Towards learning a generic agent for vision-and-language navigation via pre-training

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:02.429755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:53.108941Z digest=sha256:bf01ab089c02d3f2a49f6b40d92ee37b3cd674ed5fb13d4dd0122323edc19f24

Observation 945ffac9-c13b-4e9f-a43a-5590ceba39b7 · outbound

This paper cites A recurrent vision- and-language bert for navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation A recurrent vision- and-language bert for navigation

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:02.242691Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:53.203928Z digest=sha256:d9358d6fa8b636317b1d9b2debf88ebd602db71fa20a5fda101cd1b66085b8e2

Observation ebe4c6f3-69ba-438e-ab30-7be0acdd0fa5 · outbound

This paper cites 3d-llm: Injecting the 3d world into large language models.NeurIPS, 2023.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation 3d-llm: Injecting the 3d world into large language models.NeurIPS, 2023

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:53.285663Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:53.285663Z digest=sha256:e9169bec653a973e79d356ebace063f40a1319197b6e558665f2bcb0dd7a5f09

Observation a22bf88d-733b-4dec-b1a1-caf9e420c007 · outbound

This paper cites An Embodied Generalist Agent in 3D World.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation An Embodied Generalist Agent in 3D World

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:53.415115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:53.415115Z digest=sha256:fba03de02e4c8acb2750a351f1a5be1b6fc6605415300cd694f68c0c0797840d

Observation a393671c-a2b7-4a59-a3e5-ecbc5f59fc4a · outbound

This paper cites Clip2point: Transfer clip to point cloud classification with image-depth pre-training.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Clip2point: Transfer clip to point cloud classification with image-depth pre-training

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:02.084162Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:53.501102Z digest=sha256:62bddfe4343fa1aae3155fe3de38a4befcf77ffcb30cf8a75427afe635055c1e

Observation fcb7fd77-45ec-4480-a47d-e56f92ab226f · outbound

This paper cites Autonomous multi-view navigation via deep reinforcement learning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Autonomous multi-view navigation via deep reinforcement learning

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:01.867346Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:53.567247Z digest=sha256:dca489bf9639d224fb798458a20ae9ed539171a315b0c6cdd1cc67fb5c841f63

Observation 43932677-81df-4f63-805e-e20b81389fa8 · outbound

This paper cites Meta-explore: Ex- ploratory hierarchical vision-and-language navigation using scene object spectrum grounding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Meta-explore: Ex- ploratory hierarchical vision-and-language navigation using scene object spectrum grounding

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:01.688902Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:53.685550Z digest=sha256:248d0d2997173e9f43472171446485496a6fdba21803b12cfda2d33a08369872

Observation af25ac1b-7f06-467f-806b-2c9379fe1297 · outbound

This paper cites Sceneverse: Scaling 3d vision-language learning for grounded scene understanding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Sceneverse: Scaling 3d vision-language learning for grounded scene understanding

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:53.758535Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:53.758535Z digest=sha256:69e3e0415f77f571db0a3f62dc04a58e17df4d31cd24ec844766ea22855d839a

Observation bdcf0f27-bce6-4e8f-a9f5-070a8529295c · outbound

This paper cites Sceneverse: Scaling 3d vision-language learning for grounded scene understanding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Sceneverse: Scaling 3d vision-language learning for grounded scene understanding

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:01.505440Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:53.831877Z digest=sha256:2416bb4572a59b69d3da6f1bec2a522271059e712f6c0eb42f6e8dc2adf6468e

Observation a954ca17-1345-4920-bd16-b85d97a4781f · outbound

This paper cites Scaling up visual and vision-language representation learning with noisy text supervision.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Scaling up visual and vision-language representation learning with noisy text supervision

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:53.937478Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:53.937478Z digest=sha256:18505ddedde2a9492bdf8d70870b4b156d702b33e7e8275b6e67f8c265879162

Observation e0e30d26-ca0d-46fe-9392-3190ab0fa939 · outbound

This paper cites Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.043114Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.043114Z digest=sha256:f308b4383498868ef902e949943d2f218c80da7b7b252f44432e47451d048f0c

Observation d20e5b75-bab7-4ef4-9a68-037ff399b8a2 · outbound

This paper cites Segment anything.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Segment anything

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.120341Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.120341Z digest=sha256:446792bf4d21095ba2bcb2c6e81bb4723c6625a61cf21011c9d48fd06e85996a

Observation 4bc65567-79f4-4e10-94cc-e9eb979b0e76 · outbound

This paper cites AI2-THOR: An Interactive 3D Environment for Visual AI.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation AI2-THOR: An Interactive 3D Environment for Visual AI

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:01.284021Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:54.184933Z digest=sha256:6215ab26d4b6103d6ca0191f06cc35c4630752c38f42f8e5a39f5e4250e84b3f

Observation 78900ee0-bd7e-4085-9648-01d4a981d002 · outbound

This paper cites Room-across-room: Multi- lingual vision-and-language navigation with dense spatiotemporal grounding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Room-across-room: Multi- lingual vision-and-language navigation with dense spatiotemporal grounding

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:01.072714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:54.298479Z digest=sha256:b11a2c9f24b69fd60f917d570723201537fa256d2538fe3b883a63e3170dc3bf

Observation 7eb2eab1-cb88-453f-842c-e7bec29be4ea · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation LLaVA-OneVision: Easy Visual Task Transfer

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.343393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.343393Z digest=sha256:4b534a70e231508163f65acb797de3bf5d95729b88b40bb31c629697661e5084

Observation bb9ee419-1261-45a5-b399-c5dfc8e61bb8 · outbound

This paper cites Improving vision-and-language navigation by generating future-view image semantics.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Improving vision-and-language navigation by generating future-view image semantics

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:00.734874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:54.392246Z digest=sha256:e53461d31879547c263f580a30aa8ad3eb37d71b00cd08c8ed43f66031101774

Observation dffb12bc-4341-45b1-9b24-967f6df9bf54 · outbound

This paper cites Robust Navigation with Language Pretraining and Stochastic Sampling.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Robust Navigation with Language Pretraining and Stochastic Sampling

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.518793Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.518793Z digest=sha256:371dc4e588da1f35331effee2901f0db4e4c2de968ad58623c3c7078f32ad120

Observation 513df580-b561-427d-95e7-6f93dc7e7ac1 · outbound

This paper cites Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal trans- formers.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal trans- formers

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.606364Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.606364Z digest=sha256:f229bcbec0eacc8311d76160add59acf81a59699449b6057f9577c6f7673bbb9

Observation b5be0337-f724-48f5-88e7-cc05dbf5631a · outbound

This paper cites NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.730369Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.730369Z digest=sha256:6e4a998ab1d6ce3318e97ac1e8685fdf560cf70d0094e83b10584730d32d7a42

Observation eea42581-97ad-4948-bbf0-ed86b64c3015 · outbound

This paper cites Multi-modal situated reasoning in 3d scenes.Advances in Neural Information Processing Systems, 37:140903–140936, 2024.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Multi-modal situated reasoning in 3d scenes.Advances in Neural Information Processing Systems, 37:140903–140936, 2024

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:00.507302Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:54.843610Z digest=sha256:97446c2ef282e7dbc75565d4193ba6209b7b8b52f0d73ec4a983cb9b2f5e7522

Observation 6b4cd09e-bffe-469e-bfa5-600ef92525bf · outbound

This paper cites Visual instruction tuning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Visual instruction tuning

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.959535Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.959535Z digest=sha256:c4daf73997ff8fefe1e8d7f4054662f1ee349b7d5a8cfcacfd25a3ff24ab289e

Observation 8811b094-3f3b-4112-9130-55fdf1125a18 · outbound

This paper cites OpenShape: Scaling Up 3D Shape Representation Towards Open-World Understanding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation OpenShape: Scaling Up 3D Shape Representation Towards Open-World Understanding

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.038554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.038554Z digest=sha256:5eace6c645931f3cbd5250f0988e8a808ff9b8a642ef92433fc937e0944bf551

Observation 3b30f639-bbbb-4e5b-988e-95098dab123c · outbound

This paper cites V olumetric environment representation for vision-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation V olumetric environment representation for vision-language navigation

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.084452Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.084452Z digest=sha256:d3d3b64247d30dca161bbd64a61f69fdb005f8b78f516072adebbadf41fd833c

Observation 9d876afb-d19d-47d0-8fee-60ffbdbfc0b0 · outbound

This paper cites Bird’s-eye-view scene graph for vision-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Bird’s-eye-view scene graph for vision-language navigation

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.166727Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.166727Z digest=sha256:aca7a42efa72e7fba1a69431b31ea0870294aa03ec6b274f18072a9355b76655

Observation 9e538cdb-bffd-470c-9f79-f7afbafbb1fe · outbound

This paper cites Discuss Before Moving: Visual Language Navigation via Multi-expert Discussions.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Discuss Before Moving: Visual Language Navigation via Multi-expert Discussions

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.250115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.250115Z digest=sha256:ecd5b28134ea84abea1d07b0305043fd9c1d844340f56d6e62f60a92ee25e974

Observation 39a03453-711b-451a-9ffe-65d72760c4bf · outbound

This paper cites Scalable 3D Captioning with Pretrained Models.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Scalable 3D Captioning with Pretrained Models

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.319386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.319386Z digest=sha256:b2d4c84089922bd6c01053ea2453b63dd7db45c12281b2143e13b6f5995e36f7

Observation 3037b647-cbac-4793-bddc-87e095cc4d53 · outbound

This paper cites SQA3D: Situated Question Answering in 3D Scenes.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation SQA3D: Situated Question Answering in 3D Scenes

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.344695Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.344695Z digest=sha256:c05ab239f2cfc4dcfe8c5f6d41a271fbc79003f9cac1c4727d20d450efd68b04

Observation a34b8f07-52a7-4db5-91ca-7ef4906dd1ca · outbound

This paper cites Reverie: Remote embodied visual referring expression in real indoor environments.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Reverie: Remote embodied visual referring expression in real indoor environments

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:00.243568Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:55.378789Z digest=sha256:f7b670cce3b26bb32163bfb5541df938744a1f4f02ebe0eb2293820bc7bae0c8

Observation 51a4544e-e0be-467d-9cd5-b42f849b1292 · outbound

This paper cites Hop: history-and-order aware pre-training for vision-and-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Hop: history-and-order aware pre-training for vision-and-language navigation

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:59.950328Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:55.423524Z digest=sha256:b501b5b57012885c445fa007b7f78f4c70abde97068e6061b4b2ad6bde146367

Observation 958ec0a8-02da-4144-99e3-c054ce7e8077 · outbound

This paper cites Vln-petl: Parameter-efficient transfer learning for vision-and- language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Vln-petl: Parameter-efficient transfer learning for vision-and- language navigation

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:59.759122Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:55.482511Z digest=sha256:5ca0a473421a864392d1f8dcb53148042928da5f02ad77e074fa677f99e11733

Observation 47a8587d-5d42-479a-a22c-05576ebd4d3e · outbound

This paper cites Learning transferable visual models from natural language supervision.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Learning transferable visual models from natural language supervision

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.550229Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.550229Z digest=sha256:2078f1343ec037ee810f1163254b11053ea379d4743e972e6122df6a99df7ebc

Observation bd7a9f9c-1ecf-4663-ae8a-5e18124ef717 · outbound

This paper cites Learning transferable visual models from natural language supervision.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Learning transferable visual models from natural language supervision

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.622544Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.622544Z digest=sha256:99eb28894dc0532ea593113982ce9a77d7bff37083e4995079b6a31a6a62f5ed

Observation 302d6f8d-62f5-45df-91b4-7d7f05f7f5e7 · outbound

This paper cites Habitat: A platform for embodied ai research.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Habitat: A platform for embodied ai research

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.670785Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.670785Z digest=sha256:742ae16cbc12a960e9f1005a8e8008a644d5e88e78e0099e6697dbec4d3595e1

Observation b3ee603e-a914-4208-9194-6aeaa7e779f5 · outbound

This paper cites Semantic scene completion from a single depth image.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Semantic scene completion from a single depth image

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.765185Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.765185Z digest=sha256:61850501b06d639c9a2814c2084ff63bfe43e4f44018759ee89abeec4059b670

Observation 66e45730-928f-43b4-b4fd-a3a493cb5495 · outbound

This paper cites Learning to navigate unseen environments: Back translation with environmental dropout.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Learning to navigate unseen environments: Back translation with environmental dropout

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:59.516923Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:55.839671Z digest=sha256:de5b9a05e1eed920bb2aba8fd1be8ba1a98ab54d474d102c2bdba5fb8ece1ead

Observation 076ef3af-9947-4f6e-b23d-fc4488f3a57b · outbound

This paper cites Vision-and-dialog navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Vision-and-dialog navigation

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.914360Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.914360Z digest=sha256:91d689b258d20c6f23154493c3f3ed72332c7867963100b9a34a8e1b627ccfb6

Observation d045a787-7259-4359-afa1-8b656c83d47e · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation LLaMA: Open and Efficient Foundation Language Models

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.941109Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.941109Z digest=sha256:165576ed67267c2203b9fe3eac2e593ee604225fdf8bd55d5054d089d0246957

Observation aa6e9eed-72ef-419c-a719-81667f724bcd · outbound

This paper cites AutoML-Agent: A Multi-Agent LLM Framework for Full-Pipeline AutoML.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation AutoML-Agent: A Multi-Agent LLM Framework for Full-Pipeline AutoML

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.975100Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.975100Z digest=sha256:390404aa15e7cb71ff64ee17fa7ec094c61dafc6611c3d5228b37527b9a396dd

Observation afd67ae2-3246-4ddc-8d81-79f2a81fb221 · outbound

This paper cites Vision-and- language navigation via causal learning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Vision-and- language navigation via causal learning

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:59.429379Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:56.046968Z digest=sha256:b0ac758144c8a8e3d606b50da1fb9ec179dbd4543b4a8803ab308c2fe8a6f1f0

Observation 26942c5b-6d93-49d4-af6d-3aa246475cad · outbound

This paper cites Reinforced cross-modal matching and self-supervised imitation learning for vision-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Reinforced cross-modal matching and self-supervised imitation learning for vision-language navigation

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:59.285204Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:56.103033Z digest=sha256:05c96fa1c7e0b9e8d21f6b9dc68419a83e4b5b6062ecba28bdc41ea894643f13

Observation 976f3e18-4513-4f5e-8e84-88fb1b95bcdc · outbound

This paper cites Lavie: High-quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 133(5):3059–3078, 2025.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Lavie: High-quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 133(5):3059–3078, 2025

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.158555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.158555Z digest=sha256:3fe0c571e2708cf2a1c6260e6f429383abaa348401c7080d682d6b4e2bdb21ea

Observation 27644782-d99f-41e0-a703-7a8c054e9aad · outbound

This paper cites Bootstrapping Language-Guided Navigation Learning with Self-Refining Data Flywheel.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Bootstrapping Language-Guided Navigation Learning with Self-Refining Data Flywheel

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.212288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.212288Z digest=sha256:46e683b25bc225b54bf9b5e7c78ef68a38dd466aa44665eb416809f8faac83e3

Observation 2e025e17-6005-4031-aaf7-5bfc60d352e3 · outbound

This paper cites Florence-2: Advancing a unified representation for a variety of vision tasks.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Florence-2: Advancing a unified representation for a variety of vision tasks

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.251215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.251215Z digest=sha256:287554de0d674eab2569838440c21de268057ad715d622ee80cb6c76f2c5f1ee

Observation 1477c5e8-bb0c-4272-badf-9fd57709601c · outbound

This paper cites Pointllm: Empower- ing large language models to understand point clouds.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Pointllm: Empower- ing large language models to understand point clouds

Reference 69

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:59.086795Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:56.310794Z digest=sha256:7aae0a716495684e60678ffca18178b3e0b45cd3f6f9b3494dd0017d12f7566b

Observation 422e44f8-b0a7-4e5e-99c4-8d8709d1186e · outbound

This paper cites ULIP-2: Towards Scalable Multimodal Pre-training for 3D Understanding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation ULIP-2: Towards Scalable Multimodal Pre-training for 3D Understanding

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.370114Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.370114Z digest=sha256:b1ed174843f1eaa7e4afc4d0a0eabccabc9789e109ccabd974ef3e302b83a78b

Observation 106edb86-96d0-450b-83fc-9fbad3d7fc30 · outbound

This paper cites Qwen2.5 Technical Report.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Qwen2.5 Technical Report

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.429483Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.429483Z digest=sha256:02510ad11f417ae391b5f80802c4678079c65333a86111f7d8a32e6e4c3468b7

Observation 902165a0-6a26-4d05-ae92-bfeb755b600c · outbound

This paper cites 3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less Hallucination.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation 3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less Hallucination

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.480933Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.480933Z digest=sha256:ae3a6cf8842f39591613ed6e98f1caea277b6bbb371fd08ee86af32b7e2b42a2

Observation eea5d638-352e-4d7a-8c91-2a6825f9a949 · outbound

This paper cites Point-bert: Pre-training 3d point cloud transformers with masked point modeling.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Point-bert: Pre-training 3d point cloud transformers with masked point modeling

Reference 73

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:58.911781Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:56.514641Z digest=sha256:c993d6fd60db833f7ef37a67fc8330d5b5b5833068d0530d9c03d9eb36e20306

Observation 131b30e5-3f36-454d-af67-ee9aac0ad72e · outbound

This paper cites Mlink: Linking black-box models from multiple domains for collaborative inference.IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(10):12085–12097, 2023.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Mlink: Linking black-box models from multiple domains for collaborative inference.IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(10):12085–12097, 2023

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:58.727189Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:56.548869Z digest=sha256:2ad7bf97f6e9152b1e85abfb5c372f398d203ff370c3d9d8d8efc055f316ee4a

Observation f6907c81-9cf6-4ae2-881f-95d685a14dfc · outbound

This paper cites Building Cooperative Embodied Agents Modularly with Large Language Models.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Building Cooperative Embodied Agents Modularly with Large Language Models

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.636374Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.636374Z digest=sha256:71efd4e5a4fa446aa316f06c86ccd99f19cb5723301b1f14906e56d8068b916b

Observation 678618de-b9a8-4866-abe3-7a1395ba1550 · outbound

This paper cites Agent journey beyond rgb: Unveiling hybrid semantic-spatial environmental representations for vision-and-language navigation.arXiv preprint arXiv:2412.06465, 2024.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Agent journey beyond rgb: Unveiling hybrid semantic-spatial environmental representations for vision-and-language navigation.arXiv preprint arXiv:2412.06465, 2024

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.710272Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.710272Z digest=sha256:168d6f21c3b759983e2a954b2fe8d112ab93e7913f11f926e6a59116c872af48

Observation bf6a3967-dc8c-4814-90ad-81b871184152 · outbound

This paper cites Meta-Transformer: A Unified Framework for Multimodal Learning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Meta-Transformer: A Unified Framework for Multimodal Learning

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.782916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.782916Z digest=sha256:4d4c83117e84d42028d9b3a700705d0a39669336a6ea00fe8c3150b1d6f2d2e0

Observation 5cadbb87-d677-46db-b1a3-8baf2fd7fd94 · outbound

This paper cites Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.837386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.837386Z digest=sha256:356920e2cc82307554539e56ec003e3f2a55b0969bfeeb1acc89bf9f4a030ab3

Observation 17b84147-d9cf-4f34-80d0-cad22a36a9f8 · outbound

This paper cites Towards Learning a Generalist Model for Embodied Navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Towards Learning a Generalist Model for Embodied Navigation

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.931400Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.931400Z digest=sha256:267c8b5e2ddc111e55504364ad6009b8d4d9a5e085d6d3e52270f15092e366e2

Observation 0f462e98-b543-4ac2-a80d-5ded14db671b · outbound

This paper cites Navgpt-2: Unleashing navigational reasoning capability for large vision-language models.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Navgpt-2: Unleashing navigational reasoning capability for large vision-language models

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:57.010269Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:57.010269Z digest=sha256:c2d06969c1bf508c47da89947cfcc811dd425aae7a61894c1dc5ba3bfd4ceb93

Observation 3c0940b1-eda1-4b47-a4c7-ed158560e9fa · outbound

This paper cites SAME: Learning Generic Language-Guided Visual Navigation with State-Adaptive Mixture of Experts.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation SAME: Learning Generic Language-Guided Visual Navigation with State-Adaptive Mixture of Experts

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:57.087390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:57.087390Z digest=sha256:2e4002f00e9de0dfc629b499fb4b190d519045d37625ba9d1f01871f5532238f

Observation e2404d4a-54b4-47ff-aaef-83b712f96928 · outbound

This paper cites MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:57.129651Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:57.129651Z digest=sha256:0b796022ba780c1fede6c71d956a7d1c6406ddb15687d2ea4e935114ea16b5ea

Observation 46cea761-e513-4aba-9b82-c784db7a1807 · outbound

This paper cites Soon: Scenario oriented object navigation with graph-based exploration.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Soon: Scenario oriented object navigation with graph-based exploration

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:57.204785Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:57.204785Z digest=sha256:f7f4cdb1e6388199c664e20cd1d6c86e8d3473bd84f27e26579590354693203e

Observation 78805592-6493-44e1-a65a-4e3a85ed4905 · outbound

This paper cites Pointclip v2: Prompting clip and gpt for powerful 3d open-world learning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Pointclip v2: Prompting clip and gpt for powerful 3d open-world learning

Reference 84

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:58.547607Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:57.278766Z digest=sha256:c4e238a9b9d8f4e98e60e04d58b898574e76817f357d67aa6c6a250833251457

Observation b5278fdf-86ba-41b1-946f-243abdc0dc2a · outbound

This paper cites How would you interpret this3D point cloud?.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation How would you interpret this3D point cloud?

Reference 85

Resolution
malformed identifier
raw_fallback, observed 2026-08-07T15:02:58.380329Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:57.359393Z digest=sha256:35bc0eda60d963dac954891f67dbde869d93eb79e6c2d02107e31efdb9e958bf

Observation 4a9188a2-cffd-42bb-8cfb-ea7d60013eeb · outbound

This paper cites We express our deep respect for the contributions of the developers and researchers who have made these models and datasets available.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation We express our deep respect for the contributions of the developers and researchers who have made these models and datasets available

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:58.266308Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:02:57.418588Z digest=sha256:c79d2a3fcf11bd9e74cd2aac1bbb693f25cb5fedd378599fc41e1458ccaaef02

Pith citing papers

Observation c130f979-6912-4589-845e-75488568ee75 · inbound

Cross-Modal Navigation with Multi-Agent Reinforcement Learning cites this paper.

Cross-Modal Navigation with Multi-Agent Reinforcement Learning CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-05-11T20:31:12.658956Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-08T08:43:54.882467Z digest=sha256:210810f2de080fb07120e006e568c40bc34c6793e2022eeafe9d150b493708b3