Pith. sign in

Paper Citation Record · LEDGER

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation

As of 17 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 1 inbound Pith citation observation for arXiv:2505.16663.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.16663 v1

Coverage vector

measured 86 of 86 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:02:57.418588Z

measured 87 of 87 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-08T08:43:54.882467Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-11T20:31:12.651566Z

Reference resolution

86 of 86 outbound references displayed

  • verified exact0
  • verified fuzzy27
  • unresolved58
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 5459cc4b-f01f-431d-811e-70fa256f774c · outbound

This paper cites Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.185288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.185288Z digest=sha256:54b6f44c8b7df00dcbf7a545724f61d9923b23be601efd788ab7cc854ef550ba

Observation 6c700b45-057a-4f36-b138-e8092009fdce · outbound

This paper cites BEVBert: Multimodal Map Pre-training for Language-guided Navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation BEVBert: Multimodal Map Pre-training for Language-guided Navigation

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.260957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.260957Z digest=sha256:9787d330231c5a9c04bb05c0a9725172d0eefb49f4d7fac196f74926972d1189

Observation 12a93b6a-2de0-4a3b-acf1-c122a90bddb8 · outbound

This paper cites On Evaluation of Embodied Navigation Agents.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation On Evaluation of Embodied Navigation Agents

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.314758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.314758Z digest=sha256:2b74b294017756035618c3d410b5459bb612491694d5f7cb0b719b297aa09b17

Observation 0c0f15c6-d55d-4869-ab98-77d9bdbd8d80 · outbound

This paper cites Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.344432Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.344432Z digest=sha256:82aedad5ad1098b2f1bb6b0a478cd43542903fea8db47376ce52ddaf38c3a809

Observation 1c087e12-cdb5-48df-bb8d-3038b7c04819 · outbound

This paper cites Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.419818Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.419818Z digest=sha256:881fd0b81e89652edc00ce8f8477ba283dfc7e44fd90d423925747faf11ce270

Observation 269d6139-cfc6-4f78-92ba-cf68da220b74 · outbound

This paper cites Scanqa: 3d question answering for spatial scene understanding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Scanqa: 3d question answering for spatial scene understanding

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.497140Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.497140Z digest=sha256:120cadbd757e59af4084fd34881feb66e1cd4011eb50aaed5f54e2501736e7d0

Observation 35418d20-2502-485e-a488-1c4afad4e2b0 · outbound

This paper cites Curriculum learning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Curriculum learning

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.571795Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.571795Z digest=sha256:694d5ca4835c118b20049c96a178f35c2bd1cd05caec5922a870ada13ecca8fa

Observation 803644f5-5be0-438a-80f2-527e9f4bd7e2 · outbound

This paper cites Coyo-700m: Image-text pair dataset.https://github.com/kakaobrain/coyo-dataset, 2022.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Coyo-700m: Image-text pair dataset.https://github.com/kakaobrain/coyo-dataset, 2022

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.621725Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.621725Z digest=sha256:a27a7e6a175c99d9375327506ff9035ed0c3a395b6dc6845c602ad24efff6a83

Observation 2b8ba055-c9ed-4467-9bd8-23b8b5020ee4 · outbound

This paper cites Matterport3D: Learning from RGB-D Data in Indoor Environments.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Matterport3D: Learning from RGB-D Data in Indoor Environments

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.671815Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.671815Z digest=sha256:ca2d3c1b47ba8cc77b8eed49e64739faaeca0f82eacfcb1469657c6953b52686

Observation fca35d50-3a88-4a5c-97ec-fc333d96aade · outbound

This paper cites Conceptual 12M: Pushing web-scale image-text pre-training to recognize long-tail visual concepts.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Conceptual 12M: Pushing web-scale image-text pre-training to recognize long-tail visual concepts

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.739127Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.739127Z digest=sha256:31022b910b8457dfce6bf17370a1be9c548c4b59bf01460c4ba983450d14c9f0

Observation 21515a60-5e7f-4b5e-a449-37f90ce34a6b · outbound

This paper cites Spatialvlm: Endowing vision-language models with spatial reasoning capabilities.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Spatialvlm: Endowing vision-language models with spatial reasoning capabilities

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.818855Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.818855Z digest=sha256:87f5381c62d10895710f811a6d15d99b9c1b193d4d2566ac1e8541d64fc313db

Observation 2b0cfe7a-0f67-4cca-bc1d-f10d121e586e · outbound

This paper cites Scanrefer: 3d object localization in rgb-d scans using natural language.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Scanrefer: 3d object localization in rgb-d scans using natural language

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.889051Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.889051Z digest=sha256:cac8021640a56469e3c926291ad97a217ba8c1771c9f5e7ff6beccdb2b982d67

Observation 6f2a2215-a244-4ee0-a580-1a532f346492 · outbound

This paper cites MapGPT: Map-Guided Prompting with Adaptive Path Planning for Vision-and-Language Navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation MapGPT: Map-Guided Prompting with Adaptive Path Planning for Vision-and-Language Navigation

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.924774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.924774Z digest=sha256:bbdb5d1c238ca5464ed0e9e7ebcdb579482b8aede3fdc2042ffa45d7b7b51a5c

Observation f7c8a17c-4d9a-43c2-adf4-dc0f4a8ade47 · outbound

This paper cites History aware multimodal transformer for vision-and-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation History aware multimodal transformer for vision-and-language navigation

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:03.991389Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:52.010081Z digest=sha256:803656013cd312aba7339232dd0853d693f209bfab0bec3ce0ad57829a9ee6ca

Observation b9f94454-ca63-4994-813e-df88e8cea3a0 · outbound

This paper cites Think global, act local: Dual-scale graph transformer for vision-and-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Think global, act local: Dual-scale graph transformer for vision-and-language navigation

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:03.844366Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:52.123638Z digest=sha256:77f95edb17dfb9f0b3fb512c7541bb5bd86f0c5bc65be1a2b53b62b7ae471c5c

Observation 1357fe32-c10f-44be-bd3b-b8bce7efd881 · outbound

This paper cites Microsoft COCO Captions: Data Collection and Evaluation Server.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Microsoft COCO Captions: Data Collection and Evaluation Server

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:52.215801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:52.215801Z digest=sha256:03144e42017628d985357548e1b70f35227bf2d07bd299c50fee9a0d1e8a8044

Observation c1477e4b-6647-4c5e-a97a-220f3527a3d4 · outbound

This paper cites Scan2cap: Context-aware dense captioning in rgb-d scans.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Scan2cap: Context-aware dense captioning in rgb-d scans

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:03.544182Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:52.260377Z digest=sha256:fc05a1bc791f4fa7d6a5560cf2bd984d617de817b2335124ea38d6546217b709

Observation 293d8a3a-991d-4e9b-addf-4ada9f1f93d3 · outbound

This paper cites Gonzalez, Ion Stoica, and Eric P.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Gonzalez, Ion Stoica, and Eric P

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:52.408734Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:52.408734Z digest=sha256:67496721d6c81faae0801193afc79b3965fbef3785395447b92b9622e8bc56a4

Observation 2a60419e-8b42-47bf-b579-7db8a7d0aba5 · outbound

This paper cites Objaverse: A universe of annotated 3d objects.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Objaverse: A universe of annotated 3d objects

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:03.197958Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:52.506412Z digest=sha256:b2478a8c5be1c40e67f6c0a266f2ea452199b1a679f1233d3f57f64d5adeba5e

Observation 34b713a6-811b-4cee-9c1b-c4b1df398b0a · outbound

This paper cites Imagenet: A large-scale hierarchical image database.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Imagenet: A large-scale hierarchical image database

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:52.588652Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:52.588652Z digest=sha256:7c7252a91f9fe2a1be731bab8fa411834f1c02e9aeac8255a0a9f52f2b68b9ef

Observation 01a671c2-f7c8-4748-8754-eabc42c1e184 · outbound

This paper cites Eva: Exploring the limits of masked visual representation learning at scale.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Eva: Exploring the limits of masked visual representation learning at scale

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:52.635057Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:52.635057Z digest=sha256:00f2a995fd8e143639919701cea551f454eee481f58125ae3cc8b1c97cbf8a9f

Observation 8f8c0a50-ba21-4e3a-bbcb-6f25178918bf · outbound

This paper cites 3d-front: 3d furnished rooms with layouts and semantics.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation 3d-front: 3d furnished rooms with layouts and semantics

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:02.930641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:52.741654Z digest=sha256:8a7bc5099d833d514f93ffa3cc029bd70681590b580c2dd62e3063f9743d515a

Observation c3e6fa09-42b1-48d6-a78b-9321040f646b · outbound

This paper cites Adaptive zone-aware hierarchical planner for vision-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Adaptive zone-aware hierarchical planner for vision-language navigation

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:02.636933Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:52.829184Z digest=sha256:3a416a1103a4abefa550272bb379b47cd353499468096ebf98b1650cc4f27bcd

Observation 8a37d701-4536-4bbc-95f5-269a18e675c3 · outbound

This paper cites RoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied Navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation RoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied Navigation

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:52.927863Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:52.927863Z digest=sha256:537b18e7a1b68e49b7760dbbfee88e4d45cba08ca146b84e8ff8c3b1eb1198f7

Observation 04d85396-d76d-4cc5-b220-5ce55cc2b4be · outbound

This paper cites Multimodal fusion and vision-language models: A survey for robot vision.arXiv preprint arXiv:2504.02477, 2025.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Multimodal fusion and vision-language models: A survey for robot vision.arXiv preprint arXiv:2504.02477, 2025

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:53.009496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:53.009496Z digest=sha256:84e311e344c83da5d61bd14ad090977915937098e707a3c9f1994da62acca2cd

Observation 7bb2342d-17dc-43eb-af21-240b2d6ea61a · outbound

This paper cites Towards learning a generic agent for vision-and-language navigation via pre-training.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Towards learning a generic agent for vision-and-language navigation via pre-training

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:02.429755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:53.108941Z digest=sha256:1eceb698d48617011312204a958ad5e3dfb98a98438528cef6087b788aacb53f

Observation 945ffac9-c13b-4e9f-a43a-5590ceba39b7 · outbound

This paper cites A recurrent vision- and-language bert for navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation A recurrent vision- and-language bert for navigation

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:02.242691Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:53.203928Z digest=sha256:38e30b338e47ffd0d8f2f687e6a490f618313a2287f0edf8eb1231be45cdcbab

Observation ebe4c6f3-69ba-438e-ab30-7be0acdd0fa5 · outbound

This paper cites 3d-llm: Injecting the 3d world into large language models.NeurIPS, 2023.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation 3d-llm: Injecting the 3d world into large language models.NeurIPS, 2023

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:53.285663Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:53.285663Z digest=sha256:a02cf57e292c77301a0e4dacba4e4ae13d8baea1450aac2ffb14e219117450be

Observation a22bf88d-733b-4dec-b1a1-caf9e420c007 · outbound

This paper cites An Embodied Generalist Agent in 3D World.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation An Embodied Generalist Agent in 3D World

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:53.415115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:53.415115Z digest=sha256:9efbdf96236a104ee53e41d11a811444479939e8081ff7973b5c0862928ddda9

Observation a393671c-a2b7-4a59-a3e5-ecbc5f59fc4a · outbound

This paper cites Clip2point: Transfer clip to point cloud classification with image-depth pre-training.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Clip2point: Transfer clip to point cloud classification with image-depth pre-training

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:02.084162Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:53.501102Z digest=sha256:2a4241063dfc46d7276b78fe01ceb1d9884526c07c19141b1df6568cc51f4bf2

Observation fcb7fd77-45ec-4480-a47d-e56f92ab226f · outbound

This paper cites Autonomous multi-view navigation via deep reinforcement learning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Autonomous multi-view navigation via deep reinforcement learning

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:01.867346Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:53.567247Z digest=sha256:c61a81cc1eab6151034f60de672b97ab82ee25067ec9cd0f991b083907421ae4

Observation 43932677-81df-4f63-805e-e20b81389fa8 · outbound

This paper cites Meta-explore: Ex- ploratory hierarchical vision-and-language navigation using scene object spectrum grounding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Meta-explore: Ex- ploratory hierarchical vision-and-language navigation using scene object spectrum grounding

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:01.688902Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:53.685550Z digest=sha256:e4455f6d9595c5c490efc9bb17f07ecbd02038fd2b999fe23262c7ac42313818

Observation af25ac1b-7f06-467f-806b-2c9379fe1297 · outbound

This paper cites Sceneverse: Scaling 3d vision-language learning for grounded scene understanding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Sceneverse: Scaling 3d vision-language learning for grounded scene understanding

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:53.758535Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:53.758535Z digest=sha256:6dbf41067e55f31e8af5b891a81fcb98a3277777da076b5b44c8bae3bfe65843

Observation bdcf0f27-bce6-4e8f-a9f5-070a8529295c · outbound

This paper cites Sceneverse: Scaling 3d vision-language learning for grounded scene understanding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Sceneverse: Scaling 3d vision-language learning for grounded scene understanding

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:01.505440Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:53.831877Z digest=sha256:e5066ff7e0f5239716ba5a5f21aacd48930d249ab1ac9903bd82515466f18af1

Observation a954ca17-1345-4920-bd16-b85d97a4781f · outbound

This paper cites Scaling up visual and vision-language representation learning with noisy text supervision.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Scaling up visual and vision-language representation learning with noisy text supervision

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:53.937478Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:53.937478Z digest=sha256:dff2173054f2a7ed18db079111ea1934a71bb0262d64d96c8e6acb16bcba98fc

Observation e0e30d26-ca0d-46fe-9392-3190ab0fa939 · outbound

This paper cites Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.043114Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.043114Z digest=sha256:945b80ad4272b3598ca60b7a9146201593c83dad21fdde71a09814b930edd388

Observation d20e5b75-bab7-4ef4-9a68-037ff399b8a2 · outbound

This paper cites Segment anything.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Segment anything

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.120341Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.120341Z digest=sha256:0ee30ef5be75dc873be1bede61b97b05b27d6644142b67bc6bdcae977d9b837e

Observation 4bc65567-79f4-4e10-94cc-e9eb979b0e76 · outbound

This paper cites AI2-THOR: An Interactive 3D Environment for Visual AI.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation AI2-THOR: An Interactive 3D Environment for Visual AI

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:01.284021Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:54.184933Z digest=sha256:ea7348d12b3d104105386f292cfed18f1bbc879670d8815e97d471f1923f5593

Observation 78900ee0-bd7e-4085-9648-01d4a981d002 · outbound

This paper cites Room-across-room: Multi- lingual vision-and-language navigation with dense spatiotemporal grounding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Room-across-room: Multi- lingual vision-and-language navigation with dense spatiotemporal grounding

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:01.072714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:54.298479Z digest=sha256:3a9452c11954e8f2683dec0fb012f26f632b43c4803b099a666f5deb1233fb6f

Observation 7eb2eab1-cb88-453f-842c-e7bec29be4ea · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation LLaVA-OneVision: Easy Visual Task Transfer

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.343393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.343393Z digest=sha256:4572e12c3d30b81a613bbc0235eba6f34c77d1013e4c7be40da8b3a9267759cb

Observation bb9ee419-1261-45a5-b399-c5dfc8e61bb8 · outbound

This paper cites Improving vision-and-language navigation by generating future-view image semantics.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Improving vision-and-language navigation by generating future-view image semantics

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:00.734874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:54.392246Z digest=sha256:37ecd42e47250b8736de9328b01b55f5ad9b55ce15f9e3708166b60e738955f0

Observation dffb12bc-4341-45b1-9b24-967f6df9bf54 · outbound

This paper cites Robust Navigation with Language Pretraining and Stochastic Sampling.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Robust Navigation with Language Pretraining and Stochastic Sampling

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.518793Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.518793Z digest=sha256:ba05e12466d0cb9e014746691e2a7af9020f3e596f50c6f4780baf9e095f369a

Observation 513df580-b561-427d-95e7-6f93dc7e7ac1 · outbound

This paper cites Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal trans- formers.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal trans- formers

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.606364Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.606364Z digest=sha256:9abd3b093c0981304803aca0b041b5bedc01e5469c06610a1e9f2400836026ab

Observation b5be0337-f724-48f5-88e7-cc05dbf5631a · outbound

This paper cites NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.730369Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.730369Z digest=sha256:e7030e75bbbc25b5b6242a6285569b36fd04571f4f21caef7ad04c1e7364966f

Observation eea42581-97ad-4948-bbf0-ed86b64c3015 · outbound

This paper cites Multi-modal situated reasoning in 3d scenes.Advances in Neural Information Processing Systems, 37:140903–140936, 2024.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Multi-modal situated reasoning in 3d scenes.Advances in Neural Information Processing Systems, 37:140903–140936, 2024

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:00.507302Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:54.843610Z digest=sha256:c0dd740aa87cea60f92277dd3a54c5a3ae47924b894545dc066df6b1b3edf209

Observation 6b4cd09e-bffe-469e-bfa5-600ef92525bf · outbound

This paper cites Visual instruction tuning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Visual instruction tuning

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.959535Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.959535Z digest=sha256:e3315a40a17f38a24c56812069826b36d8eeecc9ea26310a7a1fd4858b6e6b74

Observation 8811b094-3f3b-4112-9130-55fdf1125a18 · outbound

This paper cites OpenShape: Scaling Up 3D Shape Representation Towards Open-World Understanding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation OpenShape: Scaling Up 3D Shape Representation Towards Open-World Understanding

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.038554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.038554Z digest=sha256:859333664d3140a0c7d8b4eae768c384f71b9e1922cedc72b94bac4ee01f2b24

Observation 3b30f639-bbbb-4e5b-988e-95098dab123c · outbound

This paper cites V olumetric environment representation for vision-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation V olumetric environment representation for vision-language navigation

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.084452Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.084452Z digest=sha256:22eed893e034f58ced5295fad0aebf9c0bc784a47d04bcc22e890a2c5414968b

Observation 9d876afb-d19d-47d0-8fee-60ffbdbfc0b0 · outbound

This paper cites Bird’s-eye-view scene graph for vision-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Bird’s-eye-view scene graph for vision-language navigation

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.166727Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.166727Z digest=sha256:02a627352de98e7e8a683aedacd79e327ddfeb9a5c78571eb10142a401d32193

Observation 9e538cdb-bffd-470c-9f79-f7afbafbb1fe · outbound

This paper cites Discuss Before Moving: Visual Language Navigation via Multi-expert Discussions.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Discuss Before Moving: Visual Language Navigation via Multi-expert Discussions

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.250115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.250115Z digest=sha256:e3a5afef4313b4778f3ba5efd1cc26cfdc21f37e7ddbb6d93e649d7a08eeb1a6

Observation 39a03453-711b-451a-9ffe-65d72760c4bf · outbound

This paper cites Scalable 3D Captioning with Pretrained Models.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Scalable 3D Captioning with Pretrained Models

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.319386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.319386Z digest=sha256:cb39896b3554bef91a112980b0c3e18e64dbf25a05e3d382a50875fa5e92f082

Observation 3037b647-cbac-4793-bddc-87e095cc4d53 · outbound

This paper cites SQA3D: Situated Question Answering in 3D Scenes.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation SQA3D: Situated Question Answering in 3D Scenes

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.344695Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.344695Z digest=sha256:9cbd4ae1c4b9c7506647244009ad588be7302ec696ba8b188034244a4a96e96c

Observation a34b8f07-52a7-4db5-91ca-7ef4906dd1ca · outbound

This paper cites Reverie: Remote embodied visual referring expression in real indoor environments.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Reverie: Remote embodied visual referring expression in real indoor environments

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:00.243568Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:55.378789Z digest=sha256:c2dd3fd534c28a76749980ffc4a076dc24174483e25bba09d5fc921cae6f6528

Observation 51a4544e-e0be-467d-9cd5-b42f849b1292 · outbound

This paper cites Hop: history-and-order aware pre-training for vision-and-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Hop: history-and-order aware pre-training for vision-and-language navigation

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:59.950328Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:55.423524Z digest=sha256:1e506a4cd45f2e79fc937261969fd8153708cc2d6a1b2c30d7da06d5fefa1908

Observation 958ec0a8-02da-4144-99e3-c054ce7e8077 · outbound

This paper cites Vln-petl: Parameter-efficient transfer learning for vision-and- language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Vln-petl: Parameter-efficient transfer learning for vision-and- language navigation

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:59.759122Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:55.482511Z digest=sha256:6f5876a5234c0bac43b85fa1bff94d0ddb38c769946be2d15ca987abeb9ee732

Observation 47a8587d-5d42-479a-a22c-05576ebd4d3e · outbound

This paper cites Learning transferable visual models from natural language supervision.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Learning transferable visual models from natural language supervision

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.550229Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.550229Z digest=sha256:10307283d8296c2ebba98bf9c1f7cca4d964b2572f25002b08322f449f5a8638

Observation bd7a9f9c-1ecf-4663-ae8a-5e18124ef717 · outbound

This paper cites Learning transferable visual models from natural language supervision.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Learning transferable visual models from natural language supervision

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.622544Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.622544Z digest=sha256:00bfcd31fa995763ee08efa9969cf0e0ef4dc5131be87c1c5aeb32edabd98975

Observation 302d6f8d-62f5-45df-91b4-7d7f05f7f5e7 · outbound

This paper cites Habitat: A platform for embodied ai research.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Habitat: A platform for embodied ai research

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.670785Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.670785Z digest=sha256:8c485d3c53e37983bcb53e0badab794da92bc809afc38163111dd815f45d556f

Observation b3ee603e-a914-4208-9194-6aeaa7e779f5 · outbound

This paper cites Semantic scene completion from a single depth image.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Semantic scene completion from a single depth image

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.765185Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.765185Z digest=sha256:5b3f096455bf309d20471f7fa342a1910a9ee3c035516542364db15bd6bfa694

Observation 66e45730-928f-43b4-b4fd-a3a493cb5495 · outbound

This paper cites Learning to navigate unseen environments: Back translation with environmental dropout.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Learning to navigate unseen environments: Back translation with environmental dropout

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:59.516923Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:55.839671Z digest=sha256:0661a8579bda0c1e02a5bbd3c4546b6def2865d48961a00c755fb9d5cb1ef7e6

Observation 076ef3af-9947-4f6e-b23d-fc4488f3a57b · outbound

This paper cites Vision-and-dialog navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Vision-and-dialog navigation

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.914360Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.914360Z digest=sha256:9d0372ec39c993eb8eb042220060fd13235ba0bbe7368cf9ff37301956b8e075

Observation d045a787-7259-4359-afa1-8b656c83d47e · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation LLaMA: Open and Efficient Foundation Language Models

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.941109Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.941109Z digest=sha256:49039050d1fd06dd7cec7c8978043d2058c061e70021f7cb0ae02a1b0742f558

Observation aa6e9eed-72ef-419c-a719-81667f724bcd · outbound

This paper cites AutoML-Agent: A Multi-Agent LLM Framework for Full-Pipeline AutoML.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation AutoML-Agent: A Multi-Agent LLM Framework for Full-Pipeline AutoML

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.975100Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.975100Z digest=sha256:f0e5b78e6a5ebedb6e5fb376f879059c8b747853176228ec7af986e7fca87881

Observation afd67ae2-3246-4ddc-8d81-79f2a81fb221 · outbound

This paper cites Vision-and- language navigation via causal learning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Vision-and- language navigation via causal learning

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:59.429379Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:56.046968Z digest=sha256:766a81c735a7d4bebda880afc985dd437da0778900c8d06808694c77fa001427

Observation 26942c5b-6d93-49d4-af6d-3aa246475cad · outbound

This paper cites Reinforced cross-modal matching and self-supervised imitation learning for vision-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Reinforced cross-modal matching and self-supervised imitation learning for vision-language navigation

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:59.285204Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:56.103033Z digest=sha256:a2bb486d01dc933f6afb84bb3081c158b371145cf2ee035237f4641c1308a862

Observation 976f3e18-4513-4f5e-8e84-88fb1b95bcdc · outbound

This paper cites Lavie: High-quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 133(5):3059–3078, 2025.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Lavie: High-quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 133(5):3059–3078, 2025

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.158555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.158555Z digest=sha256:ad7bfb32e7603eee89d996716d09b12f734be1c675d00c4a61970e115e908eb2

Observation 27644782-d99f-41e0-a703-7a8c054e9aad · outbound

This paper cites Bootstrapping Language-Guided Navigation Learning with Self-Refining Data Flywheel.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Bootstrapping Language-Guided Navigation Learning with Self-Refining Data Flywheel

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.212288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.212288Z digest=sha256:bc4695422b6c167b9253e9be7a425b7779fa4b8b52e86d4677fa145113ff5cf3

Observation 2e025e17-6005-4031-aaf7-5bfc60d352e3 · outbound

This paper cites Florence-2: Advancing a unified representation for a variety of vision tasks.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Florence-2: Advancing a unified representation for a variety of vision tasks

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.251215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.251215Z digest=sha256:81c9d31d3268b792343b239adca80815a12d0905ce74bfd01a421d8a624575dc

Observation 1477c5e8-bb0c-4272-badf-9fd57709601c · outbound

This paper cites Pointllm: Empower- ing large language models to understand point clouds.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Pointllm: Empower- ing large language models to understand point clouds

Reference 69

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:59.086795Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:56.310794Z digest=sha256:c6de51c172605b9fbed5b89be26903420d71519556275d51bdb1107a23558569

Observation 422e44f8-b0a7-4e5e-99c4-8d8709d1186e · outbound

This paper cites ULIP-2: Towards Scalable Multimodal Pre-training for 3D Understanding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation ULIP-2: Towards Scalable Multimodal Pre-training for 3D Understanding

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.370114Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.370114Z digest=sha256:4b957cf6b697db59c1c12528c203fad8652948fcdef95aca8c4663a27777fead

Observation 106edb86-96d0-450b-83fc-9fbad3d7fc30 · outbound

This paper cites Qwen2.5 Technical Report.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Qwen2.5 Technical Report

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.429483Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.429483Z digest=sha256:d02d442ba460299377e4c363baac7043d5886a054d73783b59f44b19bafa8433

Observation 902165a0-6a26-4d05-ae92-bfeb755b600c · outbound

This paper cites 3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less Hallucination.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation 3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less Hallucination

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.480933Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.480933Z digest=sha256:abe7560f98d460d88d9f1f65f92fb72a4f884d637287ee459b8b5d28efd17e7c

Observation eea5d638-352e-4d7a-8c91-2a6825f9a949 · outbound

This paper cites Point-bert: Pre-training 3d point cloud transformers with masked point modeling.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Point-bert: Pre-training 3d point cloud transformers with masked point modeling

Reference 73

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:58.911781Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:56.514641Z digest=sha256:ecad04a9f20636dd48563dd22104933086a77e10fa35190e4232e5700c8a6feb

Observation 131b30e5-3f36-454d-af67-ee9aac0ad72e · outbound

This paper cites Mlink: Linking black-box models from multiple domains for collaborative inference.IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(10):12085–12097, 2023.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Mlink: Linking black-box models from multiple domains for collaborative inference.IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(10):12085–12097, 2023

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:58.727189Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:56.548869Z digest=sha256:5de747451ecc286ae8765cf5ca1809ada4945fad787ff7f1e0eaa570e27a2e28

Observation f6907c81-9cf6-4ae2-881f-95d685a14dfc · outbound

This paper cites Building Cooperative Embodied Agents Modularly with Large Language Models.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Building Cooperative Embodied Agents Modularly with Large Language Models

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.636374Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.636374Z digest=sha256:cdb905d21e61df517f4910c7dde58dad8c2ed26c52d6d587b81a3f4795a63d4d

Observation 678618de-b9a8-4866-abe3-7a1395ba1550 · outbound

This paper cites Agent journey beyond rgb: Unveiling hybrid semantic-spatial environmental representations for vision-and-language navigation.arXiv preprint arXiv:2412.06465, 2024.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Agent journey beyond rgb: Unveiling hybrid semantic-spatial environmental representations for vision-and-language navigation.arXiv preprint arXiv:2412.06465, 2024

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.710272Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.710272Z digest=sha256:789b444658e2192cf88b2db7cb93281ef4c51653a99d95dfd8df088f21bc7941

Observation bf6a3967-dc8c-4814-90ad-81b871184152 · outbound

This paper cites Meta-Transformer: A Unified Framework for Multimodal Learning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Meta-Transformer: A Unified Framework for Multimodal Learning

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.782916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.782916Z digest=sha256:112746904b0cd91cc8006b2cd4cb6ea9ce7db710502d065d3ca99baeb95ec9ac

Observation 5cadbb87-d677-46db-b1a3-8baf2fd7fd94 · outbound

This paper cites Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.837386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.837386Z digest=sha256:48e482e1d05f24743d49ce17eb25edfe041e529b1784f06360387f04b9e44cfd

Observation 17b84147-d9cf-4f34-80d0-cad22a36a9f8 · outbound

This paper cites Towards Learning a Generalist Model for Embodied Navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Towards Learning a Generalist Model for Embodied Navigation

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.931400Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.931400Z digest=sha256:c5bcbc31e21a34b7d91db7f8a56d2aa6e31a34b28a1f73f3f484b2fdc87f5c10

Observation 0f462e98-b543-4ac2-a80d-5ded14db671b · outbound

This paper cites Navgpt-2: Unleashing navigational reasoning capability for large vision-language models.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Navgpt-2: Unleashing navigational reasoning capability for large vision-language models

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:57.010269Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:57.010269Z digest=sha256:a74f71aac735e723c1b5cff23fbc04332ea8d4ae2c7a45d9e639fcb161a7368f

Observation 3c0940b1-eda1-4b47-a4c7-ed158560e9fa · outbound

This paper cites SAME: Learning Generic Language-Guided Visual Navigation with State-Adaptive Mixture of Experts.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation SAME: Learning Generic Language-Guided Visual Navigation with State-Adaptive Mixture of Experts

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:57.087390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:57.087390Z digest=sha256:031516baf7f5fdb9b9c05407fea37b27c36179547ee64f2bb4b4e6fda33e4ddf

Observation e2404d4a-54b4-47ff-aaef-83b712f96928 · outbound

This paper cites MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:57.129651Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:57.129651Z digest=sha256:a4c5f2cf8a17bb46822044dc8d94ea4a487fcc14243707b3176d6d5c954f0eba

Observation 46cea761-e513-4aba-9b82-c784db7a1807 · outbound

This paper cites Soon: Scenario oriented object navigation with graph-based exploration.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Soon: Scenario oriented object navigation with graph-based exploration

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:57.204785Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:57.204785Z digest=sha256:621b1b71d25f56501f159f461c358d08202829e548b31ed319cd6215115c7c91

Observation 78805592-6493-44e1-a65a-4e3a85ed4905 · outbound

This paper cites Pointclip v2: Prompting clip and gpt for powerful 3d open-world learning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Pointclip v2: Prompting clip and gpt for powerful 3d open-world learning

Reference 84

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:58.547607Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:57.278766Z digest=sha256:e783fd761ca564b56081030c9e59ae7a473c7e8fe4bde90584adc6525193dd5f

Observation b5278fdf-86ba-41b1-946f-243abdc0dc2a · outbound

This paper cites How would you interpret this3D point cloud?.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation How would you interpret this3D point cloud?

Reference 85

Resolution
malformed identifier
raw_fallback, observed 2026-08-07T15:02:58.380329Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:57.359393Z digest=sha256:8ab414169be7448deff012668a88a846cdd9c7002ae177ee06bf957b08589d3a

Observation 4a9188a2-cffd-42bb-8cfb-ea7d60013eeb · outbound

This paper cites We express our deep respect for the contributions of the developers and researchers who have made these models and datasets available.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation We express our deep respect for the contributions of the developers and researchers who have made these models and datasets available

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:58.266308Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T15:02:57.418588Z digest=sha256:085452d221b7fd90b76aa9291368e542ec0f049701705863a92253b60e89877f

Pith citing papers

Observation c130f979-6912-4589-845e-75488568ee75 · inbound

Cross-Modal Navigation with Multi-Agent Reinforcement Learning cites this paper.

Cross-Modal Navigation with Multi-Agent Reinforcement Learning CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-05-11T20:31:12.658956Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-08T08:43:54.882467Z digest=sha256:28dbd4d48ea78ff0b7876f114fa1bdfce9ce7448de91fa5546935e3d4188a095