{"as_of":"2026-08-20T17:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:130d7d04a3d0dd3505d4d759215e803fb4ba350034e48aff7c4be209976ed8df","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:36:48.962835Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17806/citation-record","integrity":"/paper/2607.17806/integrity","json":"/paper/2607.17806/citation-record.json","paper":"/paper/2607.17806"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:49.296293Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":"e6b8cdf3-6072-48de-b89d-fdf224d0f453","year":2018},"citing_paper":{"arxiv_id":"2607.17806","last_updated":"2026-07-20T10:48:48Z","snapshot_observed_at":"2026-08-20T08:35:32.814871Z","submitted_at":"2026-07-20T10:48:48Z","title":"PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:48.887459Z"},"links":{"citing_paper":"/paper/2607.17806"},"observation_digest":"sha256:b8f3ad90529d2a9869afc6e5dc96bdb6d96bb16a9cb3eb28a7cb82966c0b6e39","observation_id":"5af842a2-c52c-4452-829e-26a8932de0e3","resolution":{"observed_at":"2026-08-15T15:36:49.301451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:48.893401Z","title":"The revolution of multimodal large language models: A survey.arXiv preprint arXiv:2402.12451, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17806","last_updated":"2026-07-20T10:48:48Z","snapshot_observed_at":"2026-08-20T08:35:32.814871Z","submitted_at":"2026-07-20T10:48:48Z","title":"PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:48.893401Z"},"links":{"citing_paper":"/paper/2607.17806"},"observation_digest":"sha256:e226da7ebf10e570c5879745b2527483a5078b15e8d1e897ccf6e1d5f368dd33","observation_id":"78f01b40-0cbe-4d14-96cb-48988ad53d10","resolution":{"observed_at":"2026-08-15T15:36:48.893401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22375","last_updated":"2025-05-29T01:59:00Z","snapshot_observed_at":"2026-08-20T00:11:32.191043Z","submitted_at":"2025-05-28T14:03:02Z","title":"Pangu Embedded: An Efficient Dual-system LLM Reasoner with Metacognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22375","snapshot_observed_at":"2026-08-15T15:36:48.898310Z","title":"Pangu Embedded: An Efficient Dual-system LLM Reasoner with Metacognition.arXiv preprint arXiv:2505.22375, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17806","last_updated":"2026-07-20T10:48:48Z","snapshot_observed_at":"2026-08-20T08:35:32.814871Z","submitted_at":"2026-07-20T10:48:48Z","title":"PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:48.898310Z"},"links":{"cited_paper":"/paper/2505.22375","citing_paper":"/paper/2607.17806"},"observation_digest":"sha256:b93f642f4985559886ce2a1a7ae741adf35de8bcd96b352b237ba8d3677180cd","observation_id":"2eeb13b3-751e-4ea1-8be8-78a2756f696c","resolution":{"observed_at":"2026-08-15T15:36:48.898310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:49.280533Z","title":"History aware multimodal transformer for vision-and-language navi- gation","venue":null,"work_id":"41b0267b-8f45-4626-99e9-47cf06e1bbff","year":2022},"citing_paper":{"arxiv_id":"2607.17806","last_updated":"2026-07-20T10:48:48Z","snapshot_observed_at":"2026-08-20T08:35:32.814871Z","submitted_at":"2026-07-20T10:48:48Z","title":"PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:48.904078Z"},"links":{"citing_paper":"/paper/2607.17806"},"observation_digest":"sha256:7fe534a8a76eff9e571e7f181267663db6bd5cd0fecb182769a27991c8fdda49","observation_id":"35bea90c-f91c-4bb2-9675-3108bb84a2b6","resolution":{"observed_at":"2026-08-15T15:36:49.285803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:49.264651Z","title":"Airbert: In-domain pretraining for vision-and-language navigation","venue":null,"work_id":"9ddbf400-1774-4da0-87b0-eeda6d0b0857","year":2021},"citing_paper":{"arxiv_id":"2607.17806","last_updated":"2026-07-20T10:48:48Z","snapshot_observed_at":"2026-08-20T08:35:32.814871Z","submitted_at":"2026-07-20T10:48:48Z","title":"PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:48.908715Z"},"links":{"citing_paper":"/paper/2607.17806"},"observation_digest":"sha256:509d9b481697d6b9dacbf28aabad5092d06f14e50df4ba284002e59c8cd47417","observation_id":"c3454965-681f-42d0-8b6e-55d18d7856e6","resolution":{"observed_at":"2026-08-15T15:36:49.269869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:49.247974Z","title":"Hu, Yelong Shen, Phillip Wallis, et al","venue":null,"work_id":"fd46fbf8-f3d0-4586-994f-0248e3a418e4","year":2022},"citing_paper":{"arxiv_id":"2607.17806","last_updated":"2026-07-20T10:48:48Z","snapshot_observed_at":"2026-08-20T08:35:32.814871Z","submitted_at":"2026-07-20T10:48:48Z","title":"PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:48.913724Z"},"links":{"citing_paper":"/paper/2607.17806"},"observation_digest":"sha256:132f9a21953f8489b2c17a3c4361d459d4ae91c8901d5a60176502c3fed6a804","observation_id":"2f87adb4-2c89-4686-b828-c5cb2b9c2fbb","resolution":{"observed_at":"2026-08-15T15:36:49.253007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:49.233214Z","title":"Navillm: Towards generalizable embodied agents via navigation instruction tuning","venue":null,"work_id":"ae8ab21b-351f-422e-a3fc-fca707e82f94","year":2024},"citing_paper":{"arxiv_id":"2607.17806","last_updated":"2026-07-20T10:48:48Z","snapshot_observed_at":"2026-08-20T08:35:32.814871Z","submitted_at":"2026-07-20T10:48:48Z","title":"PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:48.918693Z"},"links":{"citing_paper":"/paper/2607.17806"},"observation_digest":"sha256:757d1a56f71343b99f9443c6da9474288cc619eac01be1649cdc87296e0d617a","observation_id":"efeab6e3-47db-4772-a9ec-d298f7985cc6","resolution":{"observed_at":"2026-08-15T15:36:49.238026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:49.216295Z","title":"Beyond the nav- graph: Vision-and-language navigation in continuous environments","venue":null,"work_id":"8cb4a16c-e01f-4fcd-90fd-7d58a8c29396","year":2020},"citing_paper":{"arxiv_id":"2607.17806","last_updated":"2026-07-20T10:48:48Z","snapshot_observed_at":"2026-08-20T08:35:32.814871Z","submitted_at":"2026-07-20T10:48:48Z","title":"PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:48.924582Z"},"links":{"citing_paper":"/paper/2607.17806"},"observation_digest":"sha256:e5d569130b7f806d8f7a4ae2a186e961f8419686039129fb4b76ad1ac52fdfbb","observation_id":"a67ece24-f377-4077-8f97-0fedfaa7524b","resolution":{"observed_at":"2026-08-15T15:36:49.222335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:49.198620Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International Journal of Computer Vision, 2017","venue":null,"work_id":"77c82c19-4537-4800-a0fc-facf3ef8ed4e","year":2017},"citing_paper":{"arxiv_id":"2607.17806","last_updated":"2026-07-20T10:48:48Z","snapshot_observed_at":"2026-08-20T08:35:32.814871Z","submitted_at":"2026-07-20T10:48:48Z","title":"PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:48.929341Z"},"links":{"citing_paper":"/paper/2607.17806"},"observation_digest":"sha256:46191a41fcc8d7b3e36dbdfdde2bb6dae3189646980ee9a6a424564b3e61c17c","observation_id":"d24ee6a2-ade3-4ede-bafa-cf7efb6893dc","resolution":{"observed_at":"2026-08-15T15:36:49.204355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:49.181306Z","title":"Room-across- room: Multilingual vision-and-language navigation with dense spatio- temporal grounding","venue":null,"work_id":"6b727d34-59db-46b4-9530-2dd27006ec4c","year":2020},"citing_paper":{"arxiv_id":"2607.17806","last_updated":"2026-07-20T10:48:48Z","snapshot_observed_at":"2026-08-20T08:35:32.814871Z","submitted_at":"2026-07-20T10:48:48Z","title":"PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:48.934072Z"},"links":{"citing_paper":"/paper/2607.17806"},"observation_digest":"sha256:d174b0354993dcef941bb0f2218bff2514b64e411c23aeb641656f832e3ec416","observation_id":"d12a2831-7626-4a6d-a19b-f439e59d6470","resolution":{"observed_at":"2026-08-15T15:36:49.186336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-20T12:00:24.760146Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-15T15:36:48.939535Z","title":"Blip-2: Boot- strapping language-image pre-training with frozen image encoders and large language models.arXiv preprint arXiv:2301.12597, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17806","last_updated":"2026-07-20T10:48:48Z","snapshot_observed_at":"2026-08-20T08:35:32.814871Z","submitted_at":"2026-07-20T10:48:48Z","title":"PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:48.939535Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2607.17806"},"observation_digest":"sha256:ac5bbd1963f1e5b8c88939457efcd9e3a143719f9772b73d820beb973b50a094","observation_id":"5b832416-ed24-4647-a5cc-cbe1ccbcffc1","resolution":{"observed_at":"2026-08-15T15:36:48.939535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:49.165328Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"da025503-ea74-4674-86c6-fd4d263132a8","year":2014},"citing_paper":{"arxiv_id":"2607.17806","last_updated":"2026-07-20T10:48:48Z","snapshot_observed_at":"2026-08-20T08:35:32.814871Z","submitted_at":"2026-07-20T10:48:48Z","title":"PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:48.944118Z"},"links":{"citing_paper":"/paper/2607.17806"},"observation_digest":"sha256:3f6942921bec3ecfd6a099967058203482475e4f20b6c7f2d15e84e1b86dbb67","observation_id":"bd4e02dd-e080-4d02-9ef6-f1434ed50959","resolution":{"observed_at":"2026-08-15T15:36:49.170507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:49.149704Z","title":"Vi- sual instruction tuning.Advances in Neural Information Processing Systems, 2024","venue":null,"work_id":"d790f30b-9e25-4b2d-b186-136aeee3b6cf","year":2024},"citing_paper":{"arxiv_id":"2607.17806","last_updated":"2026-07-20T10:48:48Z","snapshot_observed_at":"2026-08-20T08:35:32.814871Z","submitted_at":"2026-07-20T10:48:48Z","title":"PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:48.948642Z"},"links":{"citing_paper":"/paper/2607.17806"},"observation_digest":"sha256:2a006d9a121445ae9d360bd3b1eb0b58e6c3525a4bac1ab857070bbdcda173e7","observation_id":"81ba54dd-e2da-41aa-a774-17665823e8f6","resolution":{"observed_at":"2026-08-15T15:36:49.154526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:36:49.130650Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in Neural Information Processing Systems, 2022","venue":null,"work_id":"bd40d86f-a12a-4e47-8b82-271703399819","year":2022},"citing_paper":{"arxiv_id":"2607.17806","last_updated":"2026-07-20T10:48:48Z","snapshot_observed_at":"2026-08-20T08:35:32.814871Z","submitted_at":"2026-07-20T10:48:48Z","title":"PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:48.953499Z"},"links":{"citing_paper":"/paper/2607.17806"},"observation_digest":"sha256:a3b73f8f511c1904c99eba7731eabee8aa98fbe133d561d2cb46247cece707e8","observation_id":"750c8415-03ad-4bf4-bd33-82e553c560e5","resolution":{"observed_at":"2026-08-15T15:36:49.138854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-15T15:36:48.958063Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding.arXiv preprint arXiv:2412.10302, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17806","last_updated":"2026-07-20T10:48:48Z","snapshot_observed_at":"2026-08-20T08:35:32.814871Z","submitted_at":"2026-07-20T10:48:48Z","title":"PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:48.958063Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2607.17806"},"observation_digest":"sha256:8d96e6e9ea16583614eff7b621989e00eab3de6e6d1602dbba9e461433979d09","observation_id":"adefadf2-3e05-4eec-a49a-2af3fb7e1af2","resolution":{"observed_at":"2026-08-15T15:36:48.958063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16986","last_updated":"2023-10-19T17:59:43Z","snapshot_observed_at":"2026-08-19T00:49:50.086891Z","submitted_at":"2023-05-26T14:41:06Z","title":"NavGPT: Explicit Reasoning in Vision-and-Language Navigation with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16986","snapshot_observed_at":"2026-08-15T15:36:48.962835Z","title":"Navgpt: Explicit rea- soning in vision-and-language navigation with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17806","last_updated":"2026-07-20T10:48:48Z","snapshot_observed_at":"2026-08-20T08:35:32.814871Z","submitted_at":"2026-07-20T10:48:48Z","title":"PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:48.962835Z"},"links":{"cited_paper":"/paper/2305.16986","citing_paper":"/paper/2607.17806"},"observation_digest":"sha256:cfa6de5cd82482469a7da76115bb18f73f1e2c2ee2db0f4b511b6c18ba6b1315","observation_id":"1aebbcfd-b34e-4ecb-a785-0269cc8888b5","resolution":{"observed_at":"2026-08-15T15:36:48.962835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.17806","last_updated":"2026-07-20T10:48:48Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-20T08:35:32.814871Z","submitted_at":"2026-07-20T10:48:48Z","title":"PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2607.17806."}