{"as_of":"2026-08-08T18:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:40b15003e46da3fe288532685ee26fd2d08f850e62e15023d053599664722336","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:02:57.418588Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T08:43:54.882467Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T20:31:12.651566Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"cited_work":{"arxiv_id":"2505.16663","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16663","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conav: Collaborative cross-modal reasoning for embodied navigation","venue":null,"work_id":"3ae6914f-0d07-4bcf-9e84-578703bd9c37","year":2025},"citing_paper":{"arxiv_id":"2605.06595","last_updated":"2026-05-07T17:20:34Z","snapshot_observed_at":"2026-08-03T07:19:31.097187Z","submitted_at":"2026-05-07T17:20:34Z","title":"Cross-Modal Navigation with Multi-Agent Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T08:43:54.882467Z"},"links":{"cited_paper":"/paper/2505.16663","citing_paper":"/paper/2605.06595"},"observation_digest":"sha256:210810f2de080fb07120e006e568c40bc34c6793e2022eeafe9d150b493708b3","observation_id":"c130f979-6912-4589-845e-75488568ee75","resolution":{"observed_at":"2026-05-11T20:31:12.658956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16663/citation-record","integrity":"/paper/2505.16663/integrity","json":"/paper/2505.16663/citation-record.json","paper":"/paper/2505.16663"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:51.185288Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:51.185288Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:2694e05b2cdcebc4953d4e32ed32cd9f562938f3100a298ae33d2fe73cd8606f","observation_id":"5459cc4b-f01f-431d-811e-70fa256f774c","resolution":{"observed_at":"2026-08-07T15:02:51.185288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04385","last_updated":"2023-08-03T09:39:00Z","snapshot_observed_at":"2026-08-06T09:14:26.834264Z","submitted_at":"2022-12-08T16:27:54Z","title":"BEVBert: Multimodal Map Pre-training for Language-guided Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04385","snapshot_observed_at":"2026-08-07T15:02:51.260957Z","title":"Bevbert: Topo-metric map pre-training for language-guided navigation.arXiv preprint arXiv:2212.04385, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:51.260957Z"},"links":{"cited_paper":"/paper/2212.04385","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:54a7c68cad73cf10364856792962cce784dceecaa588f315bb410ec5c501e69c","observation_id":"6c700b45-057a-4f36-b138-e8092009fdce","resolution":{"observed_at":"2026-08-07T15:02:51.260957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.06757","last_updated":"2018-07-18T03:28:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-07-18T03:28:02Z","title":"On Evaluation of Embodied Navigation Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.06757","snapshot_observed_at":"2026-08-07T15:02:51.314758Z","title":"On evaluation of embodied navigation agents.arXiv preprint arXiv:1807.06757, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:51.314758Z"},"links":{"cited_paper":"/paper/1807.06757","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:6c141524cd7b186bb1a99ac165635b462eb972355fcc4bb8085b70363995bec0","observation_id":"12a93b6a-2de0-4a3b-acf1-c122a90bddb8","resolution":{"observed_at":"2026-08-07T15:02:51.314758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:51.344432Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:51.344432Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:b066395a535d6a786aeba6b074559045f9851a9b4f87ed0d0667fa6f9d764414","observation_id":"0c0f15c6-d55d-4869-ab98-77d9bdbd8d80","resolution":{"observed_at":"2026-08-07T15:02:51.344432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:51.419818Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:51.419818Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:e33bdb29e3e8f0cb8acdbe2388959f5a16f8e96cc8b3d7847da5d3b2a9048945","observation_id":"1c087e12-cdb5-48df-bb8d-3038b7c04819","resolution":{"observed_at":"2026-08-07T15:02:51.419818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:51.497140Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:51.497140Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:eed9f5c531bfbe596608e761953aee8719338ad472c4dace870530c0e95e15f1","observation_id":"269d6139-cfc6-4f78-92ba-cf68da220b74","resolution":{"observed_at":"2026-08-07T15:02:51.497140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:51.571795Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:51.571795Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:070d5b41411af9499c1f605fb816e25811601a3ab8ab77f9d679d22b289f265c","observation_id":"35418d20-2502-485e-a488-1c4afad4e2b0","resolution":{"observed_at":"2026-08-07T15:02:51.571795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:51.621725Z","title":"Coyo-700m: Image-text pair dataset.https://github.com/kakaobrain/coyo-dataset, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:51.621725Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:b95777d00de6001b45c12a8f2f055a9469c575bdf4e9bd12684b0366bc6cd2e4","observation_id":"803644f5-5be0-438a-80f2-527e9f4bd7e2","resolution":{"observed_at":"2026-08-07T15:02:51.621725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06158","last_updated":"2017-09-18T20:34:48Z","snapshot_observed_at":"2026-08-02T16:47:23.623541Z","submitted_at":"2017-09-18T20:34:48Z","title":"Matterport3D: Learning from RGB-D Data in Indoor Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.06158","snapshot_observed_at":"2026-08-07T15:02:51.671815Z","title":"Matterport3d: Learning from rgb-d data in indoor environments","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:51.671815Z"},"links":{"cited_paper":"/paper/1709.06158","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:9b6b48f14274a0e6e3b5a07228aa3bae8bb63b6353ca87e966d7321b22b064ef","observation_id":"2b8ba055-c9ed-4467-9bd8-23b8b5020ee4","resolution":{"observed_at":"2026-08-07T15:02:51.671815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:51.739127Z","title":"Conceptual 12M: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:51.739127Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:5e0a42ad691e7e4082149bf7738f7a1ec577de0dd09b148f46f62bb35171e845","observation_id":"fca35d50-3a88-4a5c-97ec-fc333d96aade","resolution":{"observed_at":"2026-08-07T15:02:51.739127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:51.818855Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:51.818855Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:cb47a510af5c86f1c0cdb07a4a75950bfb3b13b7388ae3367019fc5f95dd0e01","observation_id":"21515a60-5e7f-4b5e-a449-37f90ce34a6b","resolution":{"observed_at":"2026-08-07T15:02:51.818855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:51.889051Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:51.889051Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:6777f0d66801a854cb7c348853d44bd68f5508ca1feb69292628ead7a102aa82","observation_id":"2b0cfe7a-0f67-4cca-bc1d-f10d121e586e","resolution":{"observed_at":"2026-08-07T15:02:51.889051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07314","last_updated":"2024-06-20T07:23:45Z","snapshot_observed_at":"2026-08-08T11:41:14.788299Z","submitted_at":"2024-01-14T15:34:48Z","title":"MapGPT: Map-Guided Prompting with Adaptive Path Planning for Vision-and-Language Navigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07314","snapshot_observed_at":"2026-08-07T15:02:51.924774Z","title":"Mapgpt: Map-guided prompting for unified vision-and-language navigation.arXiv preprint arXiv:2401.07314, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:51.924774Z"},"links":{"cited_paper":"/paper/2401.07314","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:9a4752cd9b5b7ba9f7008b1be3cf4c68f8f987bee652a005deea4e4441dc530f","observation_id":"6f2a2215-a244-4ee0-a580-1a532f346492","resolution":{"observed_at":"2026-08-07T15:02:51.924774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:03.938237Z","title":"History aware multimodal transformer for vision-and-language navigation","venue":null,"work_id":"72df7ed6-0af5-4042-934a-b8bcf52fb133","year":2021},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:52.010081Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:9932a99d8fb4c0255d8e1ba7e7f9af554dc2e3a22e04e1adf7230ab286a9ef07","observation_id":"f7c8a17c-4d9a-43c2-adf4-dc0f4a8ade47","resolution":{"observed_at":"2026-08-07T15:03:03.991389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:03.651665Z","title":"Think global, act local: Dual-scale graph transformer for vision-and-language navigation","venue":null,"work_id":"9c9dca7a-8d4c-44c8-b40c-8c54f8400fca","year":2022},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:52.123638Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:42cb578b92e3de350aab7c5622a2650d7bafcc64cc612a1391344369a52f9596","observation_id":"b9f94454-ca63-4994-813e-df88e8cea3a0","resolution":{"observed_at":"2026-08-07T15:03:03.844366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T15:02:52.215801Z","title":"Microsoft coco captions: Data collection and evaluation server.arXiv preprint arXiv:1504.00325, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:52.215801Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:1518046b2a57dc34ceec6197dd5b6de3188d1ebd582bad0462bfad51ec0c0517","observation_id":"1357fe32-c10f-44be-bd3b-b8bce7efd881","resolution":{"observed_at":"2026-08-07T15:02:52.215801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:03.351596Z","title":"Scan2cap: Context-aware dense captioning in rgb-d scans","venue":null,"work_id":"061f086e-226e-4ead-8257-3893b7063b16","year":2021},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:52.260377Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:d3c0a2d2b1f410f37727d57846c3074e3b282483eab5370806907752245ff24b","observation_id":"c1477e4b-6647-4c5e-a97a-220f3527a3d4","resolution":{"observed_at":"2026-08-07T15:03:03.544182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:52.408734Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:52.408734Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:db25f5801d2f73f5ccbea112c17727b3fa4dc40652e67bcd7ce7ba24dcb9d236","observation_id":"293d8a3a-991d-4e9b-addf-4ada9f1f93d3","resolution":{"observed_at":"2026-08-07T15:02:52.408734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:03.066857Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":"5d0a7298-3060-4556-aec0-9a6060f076bd","year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:52.506412Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:a2e43e4ef89d04630ebb939f3b8756001039d1a3416f2c9a1c898fdb77a23ac3","observation_id":"2a60419e-8b42-47bf-b579-7db8a7d0aba5","resolution":{"observed_at":"2026-08-07T15:03:03.197958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:52.588652Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:52.588652Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:fa9f713945efffe29ffad16edbe3abdd709f26156e1a8e6f8a88c611476c7b5e","observation_id":"34b713a6-811b-4cee-9c1b-c4b1df398b0a","resolution":{"observed_at":"2026-08-07T15:02:52.588652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:52.635057Z","title":"Eva: Exploring the limits of masked visual representation learning at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:52.635057Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:e3bc739d5f8811090987e467489ecbb892e172a91985bd67355b3c2001e13bfd","observation_id":"01a671c2-f7c8-4748-8754-eabc42c1e184","resolution":{"observed_at":"2026-08-07T15:02:52.635057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:02.816197Z","title":"3d-front: 3d furnished rooms with layouts and semantics","venue":null,"work_id":"a2ba7c81-5117-4b17-ba27-a60755f63e5e","year":2021},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:52.741654Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:933dd7996ecdb7b3fb87c32049e7e0f1143cc132ec18e19f769377d95fc3607a","observation_id":"8f8c0a50-ba21-4e3a-bbcb-6f25178918bf","resolution":{"observed_at":"2026-08-07T15:03:02.930641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:02.548489Z","title":"Adaptive zone-aware hierarchical planner for vision-language navigation","venue":null,"work_id":"9a579247-225b-41f0-bba9-8f8f13a8d607","year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:52.829184Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:9198d6b629a81931598f25d48a810d921ffe1ef82860ac122ecbd6d759851749","observation_id":"c3e6fa09-42b1-48d6-a78b-9321040f646b","resolution":{"observed_at":"2026-08-07T15:03:02.636933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08591","last_updated":"2025-03-19T10:05:05Z","snapshot_observed_at":"2026-07-06T20:05:28.003434Z","submitted_at":"2024-12-11T18:10:21Z","title":"RoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08591","snapshot_observed_at":"2026-08-07T15:02:52.927863Z","title":"Roomtour3d: Geometry-aware video-instruction tuning for embodied navigation.arXiv preprint arXiv:2412.08591, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:52.927863Z"},"links":{"cited_paper":"/paper/2412.08591","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:4c7f6c04668a70b838e9e25ac2e1c2009e0e511aeb5beba1e94463917711f9e2","observation_id":"8a37d701-4536-4bbc-95f5-269a18e675c3","resolution":{"observed_at":"2026-08-07T15:02:52.927863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:53.009496Z","title":"Multimodal fusion and vision-language models: A survey for robot vision.arXiv preprint arXiv:2504.02477, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:53.009496Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:f4ccc5f8fcd2aeaa422da46c0c6f79280ebb54b857a7121a1274e98b04883c13","observation_id":"04d85396-d76d-4cc5-b220-5ce55cc2b4be","resolution":{"observed_at":"2026-08-07T15:02:53.009496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:02.329665Z","title":"Towards learning a generic agent for vision-and-language navigation via pre-training","venue":null,"work_id":"fccca73e-f5dd-439e-a88b-817909bb5504","year":2020},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:53.108941Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:bf01ab089c02d3f2a49f6b40d92ee37b3cd674ed5fb13d4dd0122323edc19f24","observation_id":"7bb2342d-17dc-43eb-af21-240b2d6ea61a","resolution":{"observed_at":"2026-08-07T15:03:02.429755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:02.181173Z","title":"A recurrent vision- and-language bert for navigation","venue":null,"work_id":"b5b3df6c-0aee-4a18-9172-d90bfee682bd","year":2021},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:53.203928Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:d9358d6fa8b636317b1d9b2debf88ebd602db71fa20a5fda101cd1b66085b8e2","observation_id":"945ffac9-c13b-4e9f-a43a-5590ceba39b7","resolution":{"observed_at":"2026-08-07T15:03:02.242691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:53.285663Z","title":"3d-llm: Injecting the 3d world into large language models.NeurIPS, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:53.285663Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:e9169bec653a973e79d356ebace063f40a1319197b6e558665f2bcb0dd7a5f09","observation_id":"ebe4c6f3-69ba-438e-ab30-7be0acdd0fa5","resolution":{"observed_at":"2026-08-07T15:02:53.285663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-07T15:02:53.415115Z","title":"An embodied generalist agent in 3d world.arXiv preprint arXiv:2311.12871, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:53.415115Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:fba03de02e4c8acb2750a351f1a5be1b6fc6605415300cd694f68c0c0797840d","observation_id":"a22bf88d-733b-4dec-b1a1-caf9e420c007","resolution":{"observed_at":"2026-08-07T15:02:53.415115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:01.966711Z","title":"Clip2point: Transfer clip to point cloud classification with image-depth pre-training","venue":null,"work_id":"56c1fa6e-346a-451f-a4ec-9fd3b3635739","year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:53.501102Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:62bddfe4343fa1aae3155fe3de38a4befcf77ffcb30cf8a75427afe635055c1e","observation_id":"a393671c-a2b7-4a59-a3e5-ecbc5f59fc4a","resolution":{"observed_at":"2026-08-07T15:03:02.084162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:01.785887Z","title":"Autonomous multi-view navigation via deep reinforcement learning","venue":null,"work_id":"0104028f-4e33-4d7c-9b18-4c317cfed37c","year":2021},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:53.567247Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:dca489bf9639d224fb798458a20ae9ed539171a315b0c6cdd1cc67fb5c841f63","observation_id":"fcb7fd77-45ec-4480-a47d-e56f92ab226f","resolution":{"observed_at":"2026-08-07T15:03:01.867346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:01.586206Z","title":"Meta-explore: Ex- ploratory hierarchical vision-and-language navigation using scene object spectrum grounding","venue":null,"work_id":"5fe085b5-e1ee-4229-90bb-5dc6171eff22","year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:53.685550Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:248d0d2997173e9f43472171446485496a6fdba21803b12cfda2d33a08369872","observation_id":"43932677-81df-4f63-805e-e20b81389fa8","resolution":{"observed_at":"2026-08-07T15:03:01.688902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:53.758535Z","title":"Sceneverse: Scaling 3d vision-language learning for grounded scene understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:53.758535Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:69e3e0415f77f571db0a3f62dc04a58e17df4d31cd24ec844766ea22855d839a","observation_id":"af25ac1b-7f06-467f-806b-2c9379fe1297","resolution":{"observed_at":"2026-08-07T15:02:53.758535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:01.455636Z","title":"Sceneverse: Scaling 3d vision-language learning for grounded scene understanding","venue":null,"work_id":"d46b7f61-e949-4c6b-b4e3-574934efd470","year":null},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:53.831877Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:2416bb4572a59b69d3da6f1bec2a522271059e712f6c0eb42f6e8dc2adf6468e","observation_id":"bdcf0f27-bce6-4e8f-a9f5-070a8529295c","resolution":{"observed_at":"2026-08-07T15:03:01.505440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:53.937478Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:53.937478Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:18505ddedde2a9492bdf8d70870b4b156d702b33e7e8275b6e67f8c265879162","observation_id":"a954ca17-1345-4920-bd16-b85d97a4781f","resolution":{"observed_at":"2026-08-07T15:02:53.937478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09772","last_updated":"2025-08-19T01:06:10Z","snapshot_observed_at":"2026-08-08T02:45:17.052821Z","submitted_at":"2025-04-14T00:27:45Z","title":"Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09772","snapshot_observed_at":"2026-08-07T15:02:54.043114Z","title":"Two heads are better than one: Test-time scaling of multi-agent collaborative reasoning.arXiv preprint arXiv:2504.09772, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:54.043114Z"},"links":{"cited_paper":"/paper/2504.09772","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:f308b4383498868ef902e949943d2f218c80da7b7b252f44432e47451d048f0c","observation_id":"e0e30d26-ca0d-46fe-9392-3190ab0fa939","resolution":{"observed_at":"2026-08-07T15:02:54.043114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:54.120341Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:54.120341Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:446792bf4d21095ba2bcb2c6e81bb4723c6625a61cf21011c9d48fd06e85996a","observation_id":"d20e5b75-bab7-4ef4-9a68-037ff399b8a2","resolution":{"observed_at":"2026-08-07T15:02:54.120341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:01.181639Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","venue":null,"work_id":"8f0f1abe-11c7-486a-8a95-0015b532c6c9","year":2017},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:54.184933Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:6215ab26d4b6103d6ca0191f06cc35c4630752c38f42f8e5a39f5e4250e84b3f","observation_id":"4bc65567-79f4-4e10-94cc-e9eb979b0e76","resolution":{"observed_at":"2026-08-07T15:03:01.284021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:00.972176Z","title":"Room-across-room: Multi- lingual vision-and-language navigation with dense spatiotemporal grounding","venue":null,"work_id":"2dc4aaca-05d4-44e5-94ee-d4f38b439010","year":2020},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:54.298479Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:b11a2c9f24b69fd60f917d570723201537fa256d2538fe3b883a63e3170dc3bf","observation_id":"78900ee0-bd7e-4085-9648-01d4a981d002","resolution":{"observed_at":"2026-08-07T15:03:01.072714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T15:02:54.343393Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:54.343393Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:4b534a70e231508163f65acb797de3bf5d95729b88b40bb31c629697661e5084","observation_id":"7eb2eab1-cb88-453f-842c-e7bec29be4ea","resolution":{"observed_at":"2026-08-07T15:02:54.343393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:00.650407Z","title":"Improving vision-and-language navigation by generating future-view image semantics","venue":null,"work_id":"9733aa34-a337-482c-8c98-86c26f9693a6","year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:54.392246Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:e53461d31879547c263f580a30aa8ad3eb37d71b00cd08c8ed43f66031101774","observation_id":"bb9ee419-1261-45a5-b399-c5dfc8e61bb8","resolution":{"observed_at":"2026-08-07T15:03:00.734874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02244","last_updated":"2019-09-05T07:31:58Z","snapshot_observed_at":"2026-08-05T17:21:59.962282Z","submitted_at":"2019-09-05T07:31:58Z","title":"Robust Navigation with Language Pretraining and Stochastic Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02244","snapshot_observed_at":"2026-08-07T15:02:54.518793Z","title":"Robust navigation with language pretraining and stochastic sampling.arXiv preprint arXiv:1909.02244, 2019","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:54.518793Z"},"links":{"cited_paper":"/paper/1909.02244","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:371dc4e588da1f35331effee2901f0db4e4c2de968ad58623c3c7078f32ad120","observation_id":"dffb12bc-4341-45b1-9b24-967f6df9bf54","resolution":{"observed_at":"2026-08-07T15:02:54.518793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:54.606364Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal trans- formers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:54.606364Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:f229bcbec0eacc8311d76160add59acf81a59699449b6057f9577c6f7673bbb9","observation_id":"513df580-b561-427d-95e7-6f93dc7e7ac1","resolution":{"observed_at":"2026-08-07T15:02:54.606364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07376","last_updated":"2025-03-22T11:04:36Z","snapshot_observed_at":"2026-07-06T17:43:05.793351Z","submitted_at":"2024-03-12T07:27:02Z","title":"NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07376","snapshot_observed_at":"2026-08-07T15:02:54.730369Z","title":"Navcot: Boosting llm-based vision-and-language navigation via learning disentangled reasoning.arXiv preprint arXiv:2403.07376, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:54.730369Z"},"links":{"cited_paper":"/paper/2403.07376","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:6e4a998ab1d6ce3318e97ac1e8685fdf560cf70d0094e83b10584730d32d7a42","observation_id":"b5be0337-f724-48f5-88e7-cc05dbf5631a","resolution":{"observed_at":"2026-08-07T15:02:54.730369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:00.366425Z","title":"Multi-modal situated reasoning in 3d scenes.Advances in Neural Information Processing Systems, 37:140903–140936, 2024","venue":null,"work_id":"5ea34b91-7f12-48f2-b528-0a13a6e699aa","year":2024},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:54.843610Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:97446c2ef282e7dbc75565d4193ba6209b7b8b52f0d73ec4a983cb9b2f5e7522","observation_id":"eea42581-97ad-4948-bbf0-ed86b64c3015","resolution":{"observed_at":"2026-08-07T15:03:00.507302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:54.959535Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:54.959535Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:c4daf73997ff8fefe1e8d7f4054662f1ee349b7d5a8cfcacfd25a3ff24ab289e","observation_id":"6b4cd09e-bffe-469e-bfa5-600ef92525bf","resolution":{"observed_at":"2026-08-07T15:02:54.959535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10764","last_updated":"2023-06-16T23:31:40Z","snapshot_observed_at":"2026-08-04T10:59:33.837634Z","submitted_at":"2023-05-18T07:07:19Z","title":"OpenShape: Scaling Up 3D Shape Representation Towards Open-World Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10764","snapshot_observed_at":"2026-08-07T15:02:55.038554Z","title":"Openshape: Scaling up 3d shape representation towards open-world understanding.arXiv preprint arXiv:2305.10764, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:55.038554Z"},"links":{"cited_paper":"/paper/2305.10764","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:5eace6c645931f3cbd5250f0988e8a808ff9b8a642ef92433fc937e0944bf551","observation_id":"8811b094-3f3b-4112-9130-55fdf1125a18","resolution":{"observed_at":"2026-08-07T15:02:55.038554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:55.084452Z","title":"V olumetric environment representation for vision-language navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:55.084452Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:d3d3b64247d30dca161bbd64a61f69fdb005f8b78f516072adebbadf41fd833c","observation_id":"3b30f639-bbbb-4e5b-988e-95098dab123c","resolution":{"observed_at":"2026-08-07T15:02:55.084452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:55.166727Z","title":"Bird’s-eye-view scene graph for vision-language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:55.166727Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:aca7a42efa72e7fba1a69431b31ea0870294aa03ec6b274f18072a9355b76655","observation_id":"9d876afb-d19d-47d0-8fee-60ffbdbfc0b0","resolution":{"observed_at":"2026-08-07T15:02:55.166727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11382","last_updated":"2023-09-20T15:04:49Z","snapshot_observed_at":"2026-07-06T16:21:17.180009Z","submitted_at":"2023-09-20T15:04:49Z","title":"Discuss Before Moving: Visual Language Navigation via Multi-expert Discussions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11382","snapshot_observed_at":"2026-08-07T15:02:55.250115Z","title":"Discuss before moving: Visual language navigation via multi-expert discussions.arXiv preprint arXiv:2309.11382, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:55.250115Z"},"links":{"cited_paper":"/paper/2309.11382","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:ecd5b28134ea84abea1d07b0305043fd9c1d844340f56d6e62f60a92ee25e974","observation_id":"9e538cdb-bffd-470c-9f79-f7afbafbb1fe","resolution":{"observed_at":"2026-08-07T15:02:55.250115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07279","last_updated":"2023-06-16T03:58:15Z","snapshot_observed_at":"2026-07-06T15:41:43.459371Z","submitted_at":"2023-06-12T17:59:03Z","title":"Scalable 3D Captioning with Pretrained Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07279","snapshot_observed_at":"2026-08-07T15:02:55.319386Z","title":"Scalable 3d captioning with pretrained models.arXiv:2306.07279, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:55.319386Z"},"links":{"cited_paper":"/paper/2306.07279","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:b2d4c84089922bd6c01053ea2453b63dd7db45c12281b2143e13b6f5995e36f7","observation_id":"39a03453-711b-451a-9ffe-65d72760c4bf","resolution":{"observed_at":"2026-08-07T15:02:55.319386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-07-06T14:05:02.813765Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-07T15:02:55.344695Z","title":"Sqa3d: Situated question answering in 3d scenes.arXiv preprint arXiv:2210.07474, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:55.344695Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:c05ab239f2cfc4dcfe8c5f6d41a271fbc79003f9cac1c4727d20d450efd68b04","observation_id":"3037b647-cbac-4793-bddc-87e095cc4d53","resolution":{"observed_at":"2026-08-07T15:02:55.344695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:00.096861Z","title":"Reverie: Remote embodied visual referring expression in real indoor environments","venue":null,"work_id":"6d3296dc-bda4-4038-b03c-4bf83c2b46c1","year":2020},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:55.378789Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:f7b670cce3b26bb32163bfb5541df938744a1f4f02ebe0eb2293820bc7bae0c8","observation_id":"a34b8f07-52a7-4db5-91ca-7ef4906dd1ca","resolution":{"observed_at":"2026-08-07T15:03:00.243568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:59.870569Z","title":"Hop: history-and-order aware pre-training for vision-and-language navigation","venue":null,"work_id":"5cabe290-8308-4f9e-a693-7522a84ed334","year":2022},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:55.423524Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:b501b5b57012885c445fa007b7f78f4c70abde97068e6061b4b2ad6bde146367","observation_id":"51a4544e-e0be-467d-9cd5-b42f849b1292","resolution":{"observed_at":"2026-08-07T15:02:59.950328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:59.662670Z","title":"Vln-petl: Parameter-efficient transfer learning for vision-and- language navigation","venue":null,"work_id":"c40b01c0-d50d-4ca7-9afd-ade079937e2f","year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:55.482511Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:5ca0a473421a864392d1f8dcb53148042928da5f02ad77e074fa677f99e11733","observation_id":"958ec0a8-02da-4144-99e3-c054ce7e8077","resolution":{"observed_at":"2026-08-07T15:02:59.759122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:55.550229Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:55.550229Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:2078f1343ec037ee810f1163254b11053ea379d4743e972e6122df6a99df7ebc","observation_id":"47a8587d-5d42-479a-a22c-05576ebd4d3e","resolution":{"observed_at":"2026-08-07T15:02:55.550229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:55.622544Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:55.622544Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:99eb28894dc0532ea593113982ce9a77d7bff37083e4995079b6a31a6a62f5ed","observation_id":"bd7a9f9c-1ecf-4663-ae8a-5e18124ef717","resolution":{"observed_at":"2026-08-07T15:02:55.622544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:55.670785Z","title":"Habitat: A platform for embodied ai research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:55.670785Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:742ae16cbc12a960e9f1005a8e8008a644d5e88e78e0099e6697dbec4d3595e1","observation_id":"302d6f8d-62f5-45df-91b4-7d7f05f7f5e7","resolution":{"observed_at":"2026-08-07T15:02:55.670785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:55.765185Z","title":"Semantic scene completion from a single depth image","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:55.765185Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:61850501b06d639c9a2814c2084ff63bfe43e4f44018759ee89abeec4059b670","observation_id":"b3ee603e-a914-4208-9194-6aeaa7e779f5","resolution":{"observed_at":"2026-08-07T15:02:55.765185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:59.453052Z","title":"Learning to navigate unseen environments: Back translation with environmental dropout","venue":null,"work_id":"b7114376-f452-4f3e-b2ec-c1ce87bfb108","year":2019},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:55.839671Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:de5b9a05e1eed920bb2aba8fd1be8ba1a98ab54d474d102c2bdba5fb8ece1ead","observation_id":"66e45730-928f-43b4-b4fd-a3a493cb5495","resolution":{"observed_at":"2026-08-07T15:02:59.516923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:55.914360Z","title":"Vision-and-dialog navigation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:55.914360Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:91d689b258d20c6f23154493c3f3ed72332c7867963100b9a34a8e1b627ccfb6","observation_id":"076ef3af-9947-4f6e-b23d-fc4488f3a57b","resolution":{"observed_at":"2026-08-07T15:02:55.914360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T15:02:55.941109Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:55.941109Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:165576ed67267c2203b9fe3eac2e593ee604225fdf8bd55d5054d089d0246957","observation_id":"d045a787-7259-4359-afa1-8b656c83d47e","resolution":{"observed_at":"2026-08-07T15:02:55.941109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02958","last_updated":"2025-06-06T10:13:12Z","snapshot_observed_at":"2026-07-06T19:27:20.458797Z","submitted_at":"2024-10-03T20:01:09Z","title":"AutoML-Agent: A Multi-Agent LLM Framework for Full-Pipeline AutoML","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02958","snapshot_observed_at":"2026-08-07T15:02:55.975100Z","title":"Automl-agent: A multi-agent llm framework for full-pipeline automl.arXiv preprint arXiv:2410.02958, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:55.975100Z"},"links":{"cited_paper":"/paper/2410.02958","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:390404aa15e7cb71ff64ee17fa7ec094c61dafc6611c3d5228b37527b9a396dd","observation_id":"aa6e9eed-72ef-419c-a719-81667f724bcd","resolution":{"observed_at":"2026-08-07T15:02:55.975100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:59.378780Z","title":"Vision-and- language navigation via causal learning","venue":null,"work_id":"24e26820-14b2-4793-b8d1-855d0cae0ea1","year":2024},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:56.046968Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:b0ac758144c8a8e3d606b50da1fb9ec179dbd4543b4a8803ab308c2fe8a6f1f0","observation_id":"afd67ae2-3246-4ddc-8d81-79f2a81fb221","resolution":{"observed_at":"2026-08-07T15:02:59.429379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:59.194051Z","title":"Reinforced cross-modal matching and self-supervised imitation learning for vision-language navigation","venue":null,"work_id":"ea600d0b-53f9-4676-bade-2aacce831685","year":2019},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:56.103033Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:05c96fa1c7e0b9e8d21f6b9dc68419a83e4b5b6062ecba28bdc41ea894643f13","observation_id":"26942c5b-6d93-49d4-af6d-3aa246475cad","resolution":{"observed_at":"2026-08-07T15:02:59.285204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:56.158555Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 133(5):3059–3078, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:56.158555Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:3fe0c571e2708cf2a1c6260e6f429383abaa348401c7080d682d6b4e2bdb21ea","observation_id":"976f3e18-4513-4f5e-8e84-88fb1b95bcdc","resolution":{"observed_at":"2026-08-07T15:02:56.158555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08467","last_updated":"2025-02-28T08:06:39Z","snapshot_observed_at":"2026-08-03T20:29:39.616582Z","submitted_at":"2024-12-11T15:32:24Z","title":"Bootstrapping Language-Guided Navigation Learning with Self-Refining Data Flywheel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08467","snapshot_observed_at":"2026-08-07T15:02:56.212288Z","title":"Bootstrapping language-guided navigation learning with self-refining data flywheel","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:56.212288Z"},"links":{"cited_paper":"/paper/2412.08467","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:46e683b25bc225b54bf9b5e7c78ef68a38dd466aa44665eb416809f8faac83e3","observation_id":"27644782-d99f-41e0-a703-7a8c054e9aad","resolution":{"observed_at":"2026-08-07T15:02:56.212288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:56.251215Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:56.251215Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:287554de0d674eab2569838440c21de268057ad715d622ee80cb6c76f2c5f1ee","observation_id":"2e025e17-6005-4031-aaf7-5bfc60d352e3","resolution":{"observed_at":"2026-08-07T15:02:56.251215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:59.014968Z","title":"Pointllm: Empower- ing large language models to understand point clouds","venue":null,"work_id":"50f98f0c-52d8-4ad0-859f-b5878c33004f","year":2024},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:56.310794Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:7aae0a716495684e60678ffca18178b3e0b45cd3f6f9b3494dd0017d12f7566b","observation_id":"1477c5e8-bb0c-4272-badf-9fd57709601c","resolution":{"observed_at":"2026-08-07T15:02:59.086795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08275","last_updated":"2024-04-26T00:26:44Z","snapshot_observed_at":"2026-07-06T15:27:02.376191Z","submitted_at":"2023-05-14T23:14:09Z","title":"ULIP-2: Towards Scalable Multimodal Pre-training for 3D Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08275","snapshot_observed_at":"2026-08-07T15:02:56.370114Z","title":"Ulip-2: Towards scalable multimodal pre-training for 3d understanding.arXiv:2305.08275, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:56.370114Z"},"links":{"cited_paper":"/paper/2305.08275","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:b1ed174843f1eaa7e4afc4d0a0eabccabc9789e109ccabd974ef3e302b83a78b","observation_id":"422e44f8-b0a7-4e5e-99c4-8d8709d1186e","resolution":{"observed_at":"2026-08-07T15:02:56.370114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:02:56.429483Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:56.429483Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:02510ad11f417ae391b5f80802c4678079c65333a86111f7d8a32e6e4c3468b7","observation_id":"106edb86-96d0-450b-83fc-9fbad3d7fc30","resolution":{"observed_at":"2026-08-07T15:02:56.429483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05132","last_updated":"2025-03-20T23:06:14Z","snapshot_observed_at":"2026-08-05T02:21:47.865084Z","submitted_at":"2024-06-07T17:59:59Z","title":"3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less Hallucination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05132","snapshot_observed_at":"2026-08-07T15:02:56.480933Z","title":"3d-grand: A million-scale dataset for 3d-llms with better grounding and less hallucination","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:56.480933Z"},"links":{"cited_paper":"/paper/2406.05132","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:ae3a6cf8842f39591613ed6e98f1caea277b6bbb371fd08ee86af32b7e2b42a2","observation_id":"902165a0-6a26-4d05-ae92-bfeb755b600c","resolution":{"observed_at":"2026-08-07T15:02:56.480933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:58.821749Z","title":"Point-bert: Pre-training 3d point cloud transformers with masked point modeling","venue":null,"work_id":"db646cf4-8c9a-4551-8bab-627245eb94ed","year":2022},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:56.514641Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:c993d6fd60db833f7ef37a67fc8330d5b5b5833068d0530d9c03d9eb36e20306","observation_id":"eea5d638-352e-4d7a-8c91-2a6825f9a949","resolution":{"observed_at":"2026-08-07T15:02:58.911781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:58.662274Z","title":"Mlink: Linking black-box models from multiple domains for collaborative inference.IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(10):12085–12097, 2023","venue":null,"work_id":"0f587ddc-f91d-4a41-8ebf-1f485e44bb68","year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:56.548869Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:2ad7bf97f6e9152b1e85abfb5c372f398d203ff370c3d9d8d8efc055f316ee4a","observation_id":"131b30e5-3f36-454d-af67-ee9aac0ad72e","resolution":{"observed_at":"2026-08-07T15:02:58.727189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02485","last_updated":"2024-02-17T05:27:56Z","snapshot_observed_at":"2026-08-02T22:53:12.613357Z","submitted_at":"2023-07-05T17:59:27Z","title":"Building Cooperative Embodied Agents Modularly with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02485","snapshot_observed_at":"2026-08-07T15:02:56.636374Z","title":"Building cooperative embodied agents modularly with large language models.arXiv preprint arXiv:2307.02485, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:56.636374Z"},"links":{"cited_paper":"/paper/2307.02485","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:71efd4e5a4fa446aa316f06c86ccd99f19cb5723301b1f14906e56d8068b916b","observation_id":"f6907c81-9cf6-4ae2-881f-95d685a14dfc","resolution":{"observed_at":"2026-08-07T15:02:56.636374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:56.710272Z","title":"Agent journey beyond rgb: Unveiling hybrid semantic-spatial environmental representations for vision-and-language navigation.arXiv preprint arXiv:2412.06465, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:56.710272Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:168d6f21c3b759983e2a954b2fe8d112ab93e7913f11f926e6a59116c872af48","observation_id":"678618de-b9a8-4866-abe3-7a1395ba1550","resolution":{"observed_at":"2026-08-07T15:02:56.710272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-07-06T15:56:25.975005Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-08-07T15:02:56.782916Z","title":"Meta-transformer: A unified framework for multimodal learning.arXiv preprint arXiv:2307.10802, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:56.782916Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:4d4c83117e84d42028d9b3a700705d0a39669336a6ea00fe8c3150b1d6f2d2e0","observation_id":"bf6a3967-dc8c-4814-90ad-81b871184152","resolution":{"observed_at":"2026-08-07T15:02:56.782916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12680","last_updated":"2025-04-17T06:16:11Z","snapshot_observed_at":"2026-08-07T16:01:36.502631Z","submitted_at":"2025-04-17T06:16:11Z","title":"Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12680","snapshot_observed_at":"2026-08-07T15:02:56.837386Z","title":"Embodied-r: Collaborative framework for activating embodied spatial reasoning in foundation models via reinforcement learning.arXiv preprint arXiv:2504.12680, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:56.837386Z"},"links":{"cited_paper":"/paper/2504.12680","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:356920e2cc82307554539e56ec003e3f2a55b0969bfeeb1acc89bf9f4a030ab3","observation_id":"5cadbb87-d677-46db-b1a3-8baf2fd7fd94","resolution":{"observed_at":"2026-08-07T15:02:56.837386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02010","last_updated":"2024-04-01T07:21:52Z","snapshot_observed_at":"2026-07-06T16:56:38.112343Z","submitted_at":"2023-12-04T16:32:51Z","title":"Towards Learning a Generalist Model for Embodied Navigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02010","snapshot_observed_at":"2026-08-07T15:02:56.931400Z","title":"Towards learning a generalist model for embodied navigation.arXiv preprint arXiv:2312.02010, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:56.931400Z"},"links":{"cited_paper":"/paper/2312.02010","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:267c8b5e2ddc111e55504364ad6009b8d4d9a5e085d6d3e52270f15092e366e2","observation_id":"17b84147-d9cf-4f34-80d0-cad22a36a9f8","resolution":{"observed_at":"2026-08-07T15:02:56.931400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:57.010269Z","title":"Navgpt-2: Unleashing navigational reasoning capability for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:57.010269Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:c2d06969c1bf508c47da89947cfcc811dd425aae7a61894c1dc5ba3bfd4ceb93","observation_id":"0f462e98-b543-4ac2-a80d-5ded14db671b","resolution":{"observed_at":"2026-08-07T15:02:57.010269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05552","last_updated":"2024-12-07T06:12:53Z","snapshot_observed_at":"2026-08-01T17:35:23.946837Z","submitted_at":"2024-12-07T06:12:53Z","title":"SAME: Learning Generic Language-Guided Visual Navigation with State-Adaptive Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05552","snapshot_observed_at":"2026-08-07T15:02:57.087390Z","title":"Same: Learn- ing generic language-guided visual navigation with state-adaptive mixture of experts.arXiv preprint arXiv:2412.05552, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:57.087390Z"},"links":{"cited_paper":"/paper/2412.05552","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:2e4002f00e9de0dfc629b499fb4b190d519045d37625ba9d1f01871f5532238f","observation_id":"3c0940b1-eda1-4b47-a4c7-ed158560e9fa","resolution":{"observed_at":"2026-08-07T15:02:57.087390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T15:02:57.129651Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:57.129651Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:0b796022ba780c1fede6c71d956a7d1c6406ddb15687d2ea4e935114ea16b5ea","observation_id":"e2404d4a-54b4-47ff-aaef-83b712f96928","resolution":{"observed_at":"2026-08-07T15:02:57.129651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:57.204785Z","title":"Soon: Scenario oriented object navigation with graph-based exploration","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:57.204785Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:f7f4cdb1e6388199c664e20cd1d6c86e8d3473bd84f27e26579590354693203e","observation_id":"46cea761-e513-4aba-9b82-c784db7a1807","resolution":{"observed_at":"2026-08-07T15:02:57.204785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:58.459801Z","title":"Pointclip v2: Prompting clip and gpt for powerful 3d open-world learning","venue":null,"work_id":"265d85a2-a7db-4caa-942f-2716b487aac9","year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:57.278766Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:c4e238a9b9d8f4e98e60e04d58b898574e76817f357d67aa6c6a250833251457","observation_id":"78805592-6493-44e1-a65a-4e3a85ed4905","resolution":{"observed_at":"2026-08-07T15:02:58.547607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:58.331994Z","title":"How would you interpret this3D point cloud?","venue":null,"work_id":"db032fe8-30d2-4525-be0f-01766ce24d11","year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:57.359393Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:35bc0eda60d963dac954891f67dbde869d93eb79e6c2d02107e31efdb9e958bf","observation_id":"b5278fdf-86ba-41b1-946f-243abdc0dc2a","resolution":{"observed_at":"2026-08-07T15:02:58.380329Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:58.139725Z","title":"We express our deep respect for the contributions of the developers and researchers who have made these models and datasets available","venue":null,"work_id":"88c5a5b9-dbb5-4be4-a5e1-6d1dcc33556d","year":2025},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:57.418588Z"},"links":{"citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:c79d2a3fcf11bd9e74cd2aac1bbb693f25cb5fedd378599fc41e1458ccaaef02","observation_id":"4a9188a2-cffd-42bb-8cfb-ea7d60013eeb","resolution":{"observed_at":"2026-08-07T15:02:58.266308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 1 inbound Pith citation observation for arXiv:2505.16663."}