{"as_of":"2026-08-07T07:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab9f5deddc4e7b21729250762abdba1154605c90aef3128bf816e8ad16014ddd","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T20:53:06.964338Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:51:21.680693Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.14801","last_updated":"2026-05-14T13:12:05Z","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T13:12:05Z","title":"Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.14801","snapshot_observed_at":"2026-08-02T05:51:21.680693Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13245","last_updated":"2026-07-14T20:14:50Z","snapshot_observed_at":"2026-08-06T03:52:15.794474Z","submitted_at":"2026-07-14T20:14:50Z","title":"Just-In-Time Scene Graph Growth: Combating Perceptual Saturation in Long-Horizon Robotics","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T05:51:21.680693Z"},"links":{"cited_paper":"/paper/2605.14801","citing_paper":"/paper/2607.13245"},"observation_digest":"sha256:898c9aefb35b5fa324e649e5a6108743abe94f85cbe0843648dcfd52e2b52027","observation_id":"f5bf930a-b02c-4194-ad3c-0f7fb314fa4b","resolution":{"observed_at":"2026-08-02T05:51:21.680693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.14801/citation-record","integrity":"/paper/2605.14801/integrity","json":"/paper/2605.14801/citation-record.json","paper":"/paper/2605.14801"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.15354","last_updated":"2025-08-21T08:33:51Z","snapshot_observed_at":"2026-08-05T17:59:38.770902Z","submitted_at":"2025-08-21T08:33:51Z","title":"Sensing, Social, and Motion Intelligence in Embodied Navigation: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2508.15354","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15354","snapshot_observed_at":"2026-06-30T20:55:03.883372Z","title":"Sensing, social, and motion intelligence in embodied navigation: A comprehensive survey,","venue":null,"work_id":"b69170c0-49ca-4c5e-ad6a-265c42c8f942","year":2025},"citing_paper":{"arxiv_id":"2605.14801","last_updated":"2026-05-14T13:12:05Z","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T13:12:05Z","title":"Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T20:53:06.964338Z"},"links":{"cited_paper":"/paper/2508.15354","citing_paper":"/paper/2605.14801"},"observation_digest":"sha256:55d41c3597ac482b656d405a6cc5aa5a65417fb9604c97e826c6ef9ae54fc16d","observation_id":"8bb202a4-4bd9-4b49-afec-331e877941d4","resolution":{"observed_at":"2026-06-30T20:55:03.885454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.01477","doi":"10.48550/arxiv.2603.01477","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2026 , eprint =","venue":"arXiv (Cornell University)","work_id":"7c38a636-50e8-4fda-8c62-1cc6d6bec488","year":2026},"citing_paper":{"arxiv_id":"2605.14801","last_updated":"2026-05-14T13:12:05Z","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T13:12:05Z","title":"Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T20:53:06.964338Z"},"links":{"citing_paper":"/paper/2605.14801"},"observation_digest":"sha256:c511917ad10d8bc70c5b413d94653ff4f342591da6a80d2c60e7ce62968a1667","observation_id":"88cff52e-737d-4491-b6b4-b760b3b7fcb7","resolution":{"observed_at":"2026-06-30T20:55:03.882072Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:54:02.004834Z","title":"Navcot: Boosting llm-based vision-and-language naviga- tion via learning disentangled reasoning,","venue":null,"work_id":"c9e8976d-cf09-44fb-a3a3-bce2abeedc50","year":2025},"citing_paper":{"arxiv_id":"2605.14801","last_updated":"2026-05-14T13:12:05Z","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T13:12:05Z","title":"Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T20:53:06.964338Z"},"links":{"citing_paper":"/paper/2605.14801"},"observation_digest":"sha256:5b434acecdb9ae9713e1e261a34ec39f37e203b892a225c657a2fe3d60fc7525","observation_id":"5eb36027-246a-47f0-9930-4aa2631314ec","resolution":{"observed_at":"2026-07-07T18:54:02.006706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:54:02.001920Z","title":"Blip: Bootstrapping language- image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":"5d63a1b1-b8a3-4efc-8313-675617d6bc66","year":2022},"citing_paper":{"arxiv_id":"2605.14801","last_updated":"2026-05-14T13:12:05Z","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T13:12:05Z","title":"Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T20:53:06.964338Z"},"links":{"citing_paper":"/paper/2605.14801"},"observation_digest":"sha256:afc8b917d639475e0c2258a11c82ba36c465b31b3b0072c1328c3870e2430880","observation_id":"d945913c-4191-4f4f-81ff-eb58e339a8f7","resolution":{"observed_at":"2026-07-07T18:54:02.004084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:54:01.990946Z","title":"NavGPT: Explicit reasoning in vision- and-language navigation with large language models,","venue":null,"work_id":"3781957f-4f1a-46f3-bb96-5123386111cf","year":2024},"citing_paper":{"arxiv_id":"2605.14801","last_updated":"2026-05-14T13:12:05Z","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T13:12:05Z","title":"Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T20:53:06.964338Z"},"links":{"citing_paper":"/paper/2605.14801"},"observation_digest":"sha256:f095f1511800f7cfbe47dbc8870fb6d0281647680991fc6fd8ab79ad2a29c896","observation_id":"d5a66d51-96d6-4b34-8089-38848f80d46b","resolution":{"observed_at":"2026-07-07T18:54:01.992815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":"2301.12597","doi":"10.48550/arxiv.2301.12597","metadata_source":"pith","pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":"cs.CV","work_id":"63d03f4d-15f4-4583-8286-913c19f02294","year":2023},"citing_paper":{"arxiv_id":"2605.14801","last_updated":"2026-05-14T13:12:05Z","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T13:12:05Z","title":"Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T20:53:06.964338Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2605.14801"},"observation_digest":"sha256:8d9353b9f1d1208c556decf68c4e594b89de9cc1dc71203a77bb8ffcb6971398","observation_id":"cad9d981-959c-4209-beba-f681d7280729","resolution":{"observed_at":"2026-06-30T20:55:03.889368Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.14801","last_updated":"2026-05-14T13:12:05Z","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T13:12:05Z","title":"Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T20:53:06.964338Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.14801"},"observation_digest":"sha256:0a448386fd2ceb24a6dd7cd589a54584e0cfb8e7d6a8d820ada3f20cc3cc60ad","observation_id":"57e68df1-1f6c-47ca-9bce-1ae29892a405","resolution":{"observed_at":"2026-06-30T20:55:03.896309Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:54:01.993648Z","title":"MapGPT: Map-guided prompting with adaptive path planning for vision-and- language navigation,","venue":null,"work_id":"ee5ecb35-fdf4-4c10-a251-96da84b510ea","year":2024},"citing_paper":{"arxiv_id":"2605.14801","last_updated":"2026-05-14T13:12:05Z","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T13:12:05Z","title":"Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T20:53:06.964338Z"},"links":{"citing_paper":"/paper/2605.14801"},"observation_digest":"sha256:6730cf1be68176fccc94b5873d9120b0ea99dae8b17ec4398714a370cc6d86c2","observation_id":"ee8a0c53-0565-499a-bb3f-dc4feb44071d","resolution":{"observed_at":"2026-07-07T18:54:01.995798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:54:02.007403Z","title":"Open-nav: Exploring zero-shot vision-and-language naviga- tion in continuous environment with open-source llms,","venue":null,"work_id":"96feeddd-d919-4fe0-a25d-5b3b57ad2279","year":2025},"citing_paper":{"arxiv_id":"2605.14801","last_updated":"2026-05-14T13:12:05Z","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T13:12:05Z","title":"Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T20:53:06.964338Z"},"links":{"citing_paper":"/paper/2605.14801"},"observation_digest":"sha256:b41bd22ac42c559efcd517ce43dd62093504b35c41eb6ff884ffcea82017f4f8","observation_id":"6603ba9b-ad7a-4b93-a40d-9422f03fd1a5","resolution":{"observed_at":"2026-07-07T18:54:02.009248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:54:01.999127Z","title":"Spatialbot: Precise spatial understanding with vision lan- guage models,","venue":null,"work_id":"e135df7e-f8e8-4bb4-894f-5090a696499e","year":2025},"citing_paper":{"arxiv_id":"2605.14801","last_updated":"2026-05-14T13:12:05Z","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T13:12:05Z","title":"Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T20:53:06.964338Z"},"links":{"citing_paper":"/paper/2605.14801"},"observation_digest":"sha256:48731824afd425fc9a3af9425a311d73175ddde0cebbcc9d65fbad5028d6cb91","observation_id":"641147b6-f487-413d-b29b-251d20a36c07","resolution":{"observed_at":"2026-07-07T18:54:02.000869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:54:01.996601Z","title":"Recognize anything: A strong image tagging model,","venue":null,"work_id":"ae254dd9-0985-4ad1-9dab-88c1e884739a","year":2024},"citing_paper":{"arxiv_id":"2605.14801","last_updated":"2026-05-14T13:12:05Z","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T13:12:05Z","title":"Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T20:53:06.964338Z"},"links":{"citing_paper":"/paper/2605.14801"},"observation_digest":"sha256:fa57bd9326d6172436d0d0252906212744c0c739dea2c55410118c64dedcd95f","observation_id":"e2ebdaa7-f069-4ab9-8d83-1de242203d27","resolution":{"observed_at":"2026-07-07T18:54:01.998458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:54:02.009923Z","title":"Fast r-cnn,","venue":null,"work_id":"c8e52b71-801a-4d2c-8fd4-4249238f4ae9","year":2015},"citing_paper":{"arxiv_id":"2605.14801","last_updated":"2026-05-14T13:12:05Z","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T13:12:05Z","title":"Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T20:53:06.964338Z"},"links":{"citing_paper":"/paper/2605.14801"},"observation_digest":"sha256:4e6bdf9507aa275b075f8cefde486151fd0de3ae72c3d62fd52fd2a2858ede0d","observation_id":"06bd5bf7-9ebf-4369-ba45-197aba4cd2f5","resolution":{"observed_at":"2026-07-07T18:54:02.011488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11811","last_updated":"2025-02-12T05:16:17Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:57:06Z","title":"EmbodiedSAM: Online Segment Any 3D Thing in Real Time","version":3},"cited_work":{"arxiv_id":"2408.11811","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11811","snapshot_observed_at":"2026-07-03T21:08:57.855469Z","title":"arXiv preprint arXiv:2408.11811 (2024)","venue":null,"work_id":"d28a68f8-542d-46f2-8b23-dbf7c858f2a3","year":2024},"citing_paper":{"arxiv_id":"2605.14801","last_updated":"2026-05-14T13:12:05Z","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T13:12:05Z","title":"Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T20:53:06.964338Z"},"links":{"cited_paper":"/paper/2408.11811","citing_paper":"/paper/2605.14801"},"observation_digest":"sha256:7d650b0c7f5a11f5e632f8069f7a482373054fbd002e3411de279822ad3d8b7b","observation_id":"3ff4f8b9-bc30-4b45-a74c-c2ad14bbd16b","resolution":{"observed_at":"2026-06-30T20:55:03.893407Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:54:01.988241Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments,","venue":null,"work_id":"f6c89535-8b8d-4d93-ad4d-69cb1979de43","year":2018},"citing_paper":{"arxiv_id":"2605.14801","last_updated":"2026-05-14T13:12:05Z","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T13:12:05Z","title":"Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T20:53:06.964338Z"},"links":{"citing_paper":"/paper/2605.14801"},"observation_digest":"sha256:f72ee21467c49ebf0e9ac3e8505272010d6df3cf920592e6c54d61f9b9f35af5","observation_id":"6a1b0c9f-4da1-4728-9a1e-8a3b7d64e5ea","resolution":{"observed_at":"2026-07-07T18:54:01.990190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.14405","last_updated":"2022-07-01T05:29:15Z","snapshot_observed_at":"2026-07-06T11:23:37.158890Z","submitted_at":"2021-06-28T05:42:15Z","title":"Habitat 2.0: Training Home Assistants to Rearrange their Habitat","version":2},"cited_work":{"arxiv_id":"2106.14405","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.14405","snapshot_observed_at":"2026-07-03T20:58:58.085131Z","title":"Habitat 2.0: Training home assistants to rearrange their habitat","venue":null,"work_id":"7199e292-4edf-4b0e-9e1f-09da09d09551","year":2021},"citing_paper":{"arxiv_id":"2605.14801","last_updated":"2026-05-14T13:12:05Z","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T13:12:05Z","title":"Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T20:53:06.964338Z"},"links":{"cited_paper":"/paper/2106.14405","citing_paper":"/paper/2605.14801"},"observation_digest":"sha256:6f83b8362115f67c7232b54a8c2e77887f87cce21b238b308dd2967519fa50ab","observation_id":"32e26628-699f-4284-b9bc-fdf56ed7735b","resolution":{"observed_at":"2026-06-30T20:55:03.900022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:54:02.012258Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes,","venue":null,"work_id":"e8c50785-1450-4725-b0b7-a16530c3435b","year":2017},"citing_paper":{"arxiv_id":"2605.14801","last_updated":"2026-05-14T13:12:05Z","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T13:12:05Z","title":"Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T20:53:06.964338Z"},"links":{"citing_paper":"/paper/2605.14801"},"observation_digest":"sha256:dfe256db4cbebcd19180f9ce6c3822be2f2dceb8aa2dce13e246e5b9b2b80795","observation_id":"05856693-ba6b-41ed-8e8d-3e04635f3e32","resolution":{"observed_at":"2026-07-07T18:54:02.014243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.14801","last_updated":"2026-05-14T13:12:05Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T13:12:05Z","title":"Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":3,"verified_fuzzy":10},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 1 inbound Pith citation observation for arXiv:2605.14801."}