{"as_of":"2026-08-12T13:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0c46bbec3d7c7e0ce742811e1fa1516c3e8f2506c18ade8f698170222d7a7ec7","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:35:44.116335Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.10172/citation-record","integrity":"/paper/2506.10172/integrity","json":"/paper/2506.10172/citation-record.json","paper":"/paper/2506.10172"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T04:35:44.061335Z","title":"Flamingo: A visual language model for few-shot learn- ing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10172","last_updated":"2025-06-11T20:51:58Z","snapshot_observed_at":"2026-08-07T04:30:19.291758Z","submitted_at":"2025-06-11T20:51:58Z","title":"A Navigation Framework Utilizing Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:44.061335Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.10172"},"observation_digest":"sha256:fde2c69e795a01292a3937b99f935509c42072c4b1601da9504d4f62502774b9","observation_id":"7a7396c1-0d9e-40bb-8825-e7a11f03ed87","resolution":{"observed_at":"2026-08-07T04:35:44.061335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:35:44.358554Z","title":"Bevbert: Multimodal map pre-training for language-guided navigation","venue":null,"work_id":"a57d3475-79cc-4241-bad4-56cda2350a9b","year":2023},"citing_paper":{"arxiv_id":"2506.10172","last_updated":"2025-06-11T20:51:58Z","snapshot_observed_at":"2026-08-07T04:30:19.291758Z","submitted_at":"2025-06-11T20:51:58Z","title":"A Navigation Framework Utilizing Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:44.066117Z"},"links":{"citing_paper":"/paper/2506.10172"},"observation_digest":"sha256:f6e7c1ebf4c852934569002bb5ca4231776160850f67337f220135fab7b30f3a","observation_id":"b0eb695b-3ec3-4d23-83c0-eb920ac9b74e","resolution":{"observed_at":"2026-08-07T04:35:44.361249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:35:44.350750Z","title":"Etpnav: Evolving topo- logical planning for vision-language navigation in continu- ous environments","venue":null,"work_id":"2a6a241a-09a1-433f-a49f-da7cac70881e","year":2024},"citing_paper":{"arxiv_id":"2506.10172","last_updated":"2025-06-11T20:51:58Z","snapshot_observed_at":"2026-08-07T04:30:19.291758Z","submitted_at":"2025-06-11T20:51:58Z","title":"A Navigation Framework Utilizing Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:44.069510Z"},"links":{"citing_paper":"/paper/2506.10172"},"observation_digest":"sha256:d74183d785cf4095f329bad39689b80ad96873e51c43c1738080fc8a2fa0b9e2","observation_id":"87c89031-327b-4c37-bf53-6982c9064a48","resolution":{"observed_at":"2026-08-07T04:35:44.353581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:35:44.342430Z","title":"Vision-and-language navigation: In- terpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":"6b5a233f-079e-4252-b4c5-8d9bde93a34b","year":2018},"citing_paper":{"arxiv_id":"2506.10172","last_updated":"2025-06-11T20:51:58Z","snapshot_observed_at":"2026-08-07T04:30:19.291758Z","submitted_at":"2025-06-11T20:51:58Z","title":"A Navigation Framework Utilizing Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:44.072677Z"},"links":{"citing_paper":"/paper/2506.10172"},"observation_digest":"sha256:93a7d750fa2f899341eadcc82975e2d08e233b9ea4c698acc7b93f00d62de4be","observation_id":"ae9f9c2d-a72e-4693-b883-b74f2095a0cd","resolution":{"observed_at":"2026-08-07T04:35:44.345543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06158","last_updated":"2017-09-18T20:34:48Z","snapshot_observed_at":"2026-08-02T16:47:23.623541Z","submitted_at":"2017-09-18T20:34:48Z","title":"Matterport3D: Learning from RGB-D Data in Indoor Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.06158","snapshot_observed_at":"2026-08-07T04:35:44.076043Z","title":"Chang, Angela Dai, Thomas A","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.10172","last_updated":"2025-06-11T20:51:58Z","snapshot_observed_at":"2026-08-07T04:30:19.291758Z","submitted_at":"2025-06-11T20:51:58Z","title":"A Navigation Framework Utilizing Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:44.076043Z"},"links":{"cited_paper":"/paper/1709.06158","citing_paper":"/paper/2506.10172"},"observation_digest":"sha256:9faabdac52eb66391764f5b7465e12d23f83acc6828dc76e4e87da7b00c376bd","observation_id":"e5c17b20-260f-496d-8101-8280107f0c6c","resolution":{"observed_at":"2026-08-07T04:35:44.076043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2304.09396","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:35:44.245650Z","title":"Vlmaps: Extracting world knowledge from pre-trained vision-language models for zero-shot visual navigation","venue":null,"work_id":"149fce68-f785-410d-91cc-78b3e6a6f9e2","year":2023},"citing_paper":{"arxiv_id":"2506.10172","last_updated":"2025-06-11T20:51:58Z","snapshot_observed_at":"2026-08-07T04:30:19.291758Z","submitted_at":"2025-06-11T20:51:58Z","title":"A Navigation Framework Utilizing Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:44.079261Z"},"links":{"citing_paper":"/paper/2506.10172"},"observation_digest":"sha256:00cec57a2d1afc2b6fb888d78377c61dd89d94f2a569ce9a35aff7efe4e35c80","observation_id":"936c4e2c-9221-4ed4-81a8-5ccd91f526a8","resolution":{"observed_at":"2026-08-07T04:35:44.250933Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:35:44.333634Z","title":"Etp- nav: Efficient trajectory planning for instruction-following embodied navigation","venue":null,"work_id":"ae902418-f297-42e3-ad2e-7af721b4672a","year":2023},"citing_paper":{"arxiv_id":"2506.10172","last_updated":"2025-06-11T20:51:58Z","snapshot_observed_at":"2026-08-07T04:30:19.291758Z","submitted_at":"2025-06-11T20:51:58Z","title":"A Navigation Framework Utilizing Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:44.082560Z"},"links":{"citing_paper":"/paper/2506.10172"},"observation_digest":"sha256:b78e79929ff19e3fb971971ac86c24e736c9ee6b467be9e78a4995ef23a515ae","observation_id":"da448fd3-ff8e-4d80-96dd-13d502b1cc5f","resolution":{"observed_at":"2026-08-07T04:35:44.336757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:35:44.325941Z","title":"Beyond the nav-graph: Vision and language navigation in continuous environments","venue":null,"work_id":"5794fde8-f2c9-469b-aa38-495254de171b","year":2020},"citing_paper":{"arxiv_id":"2506.10172","last_updated":"2025-06-11T20:51:58Z","snapshot_observed_at":"2026-08-07T04:30:19.291758Z","submitted_at":"2025-06-11T20:51:58Z","title":"A Navigation Framework Utilizing Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:44.085721Z"},"links":{"citing_paper":"/paper/2506.10172"},"observation_digest":"sha256:73bd4745b8833ab2dede2d018841dd5a49eded7ef4d572b18f8d607d0c49ff2d","observation_id":"23ce9c76-8dfc-45bb-b596-8432493960d2","resolution":{"observed_at":"2026-08-07T04:35:44.328776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:35:44.316498Z","title":"Mem2ego: Empowering vision-language models with global-to-ego memory for long-horizon embodied naviga- tion","venue":null,"work_id":"72720402-cf3b-40b5-b82a-3a8dd598f3c1","year":2024},"citing_paper":{"arxiv_id":"2506.10172","last_updated":"2025-06-11T20:51:58Z","snapshot_observed_at":"2026-08-07T04:30:19.291758Z","submitted_at":"2025-06-11T20:51:58Z","title":"A Navigation Framework Utilizing Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:44.088445Z"},"links":{"citing_paper":"/paper/2506.10172"},"observation_digest":"sha256:e815119a0342a14f2c8654a78809b3bfbcf732ce20a1c99c698229bbeb6fb48f","observation_id":"a482e6f2-a4d3-46e5-832c-7021e9a29022","resolution":{"observed_at":"2026-08-07T04:35:44.320319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:35:44.307384Z","title":"Habitat 3.0: A co-habitat for humans, avatars and robots, 2023","venue":null,"work_id":"8491ef4d-3068-475a-a1ee-f2526438ebfc","year":2023},"citing_paper":{"arxiv_id":"2506.10172","last_updated":"2025-06-11T20:51:58Z","snapshot_observed_at":"2026-08-07T04:30:19.291758Z","submitted_at":"2025-06-11T20:51:58Z","title":"A Navigation Framework Utilizing Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:44.091762Z"},"links":{"citing_paper":"/paper/2506.10172"},"observation_digest":"sha256:b82d8d74c12a2d017619b363e1ef6ae8bda808321f3c459a136fa7442482ea91","observation_id":"fc4e8794-8d35-4cce-adb8-cc6c05251b86","resolution":{"observed_at":"2026-08-07T04:35:44.310581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:35:44.298806Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"9e555481-88a8-41e2-a4a1-c05ac51e0cbc","year":2021},"citing_paper":{"arxiv_id":"2506.10172","last_updated":"2025-06-11T20:51:58Z","snapshot_observed_at":"2026-08-07T04:30:19.291758Z","submitted_at":"2025-06-11T20:51:58Z","title":"A Navigation Framework Utilizing Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:44.094571Z"},"links":{"citing_paper":"/paper/2506.10172"},"observation_digest":"sha256:630420c075ff16ba85ea874cb266b3348ed2fd931b91b0d63eab4ef4b588d866","observation_id":"11cb8350-025a-4fb3-ba18-f8987d9972b9","resolution":{"observed_at":"2026-08-07T04:35:44.301878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:35:44.097436Z","title":"Habitat 2.0: Training home assistants to rearrange their habitat","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10172","last_updated":"2025-06-11T20:51:58Z","snapshot_observed_at":"2026-08-07T04:30:19.291758Z","submitted_at":"2025-06-11T20:51:58Z","title":"A Navigation Framework Utilizing Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:44.097436Z"},"links":{"citing_paper":"/paper/2506.10172"},"observation_digest":"sha256:54296c6ba65776901ae54d22690404fc9a5a3c96659fa7cc163e2a3dbf76584c","observation_id":"704ac10f-7ae7-493f-99d2-a5007bf1a98a","resolution":{"observed_at":"2026-08-07T04:35:44.097436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:35:44.284105Z","title":"Qwen2.5-vl, 2025","venue":null,"work_id":"16083348-9940-4aea-afec-71e27559f98f","year":2025},"citing_paper":{"arxiv_id":"2506.10172","last_updated":"2025-06-11T20:51:58Z","snapshot_observed_at":"2026-08-07T04:30:19.291758Z","submitted_at":"2025-06-11T20:51:58Z","title":"A Navigation Framework Utilizing Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:44.100566Z"},"links":{"citing_paper":"/paper/2506.10172"},"observation_digest":"sha256:ad5fae167921c323df036d962faa92c52cda35a7e3286b49411894bcc7f2c39a","observation_id":"fdd1c6ff-27bd-4226-895f-0d7496838633","resolution":{"observed_at":"2026-08-07T04:35:44.286952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T04:35:44.103599Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10172","last_updated":"2025-06-11T20:51:58Z","snapshot_observed_at":"2026-08-07T04:30:19.291758Z","submitted_at":"2025-06-11T20:51:58Z","title":"A Navigation Framework Utilizing Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:44.103599Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.10172"},"observation_digest":"sha256:ff337a7fb8c6e78ce66508f802f7d60a07e64e3379bd108d64f21ad592c56720","observation_id":"ab0e8cad-3a21-403f-be9e-fc073ee3e897","resolution":{"observed_at":"2026-08-07T04:35:44.103599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12739","last_updated":"2023-09-18T09:17:18Z","snapshot_observed_at":"2026-07-06T14:45:55.345502Z","submitted_at":"2023-01-30T09:03:10Z","title":"FractalAD: A simple industrial anomaly detection method using fractal anomaly generation and backbone knowledge distillation","version":3},"cited_work":{"arxiv_id":"2301.12739","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.12739","snapshot_observed_at":"2026-08-07T04:35:44.171716Z","title":"FractalAD: A simple industrial anomaly detection method using fractal anomaly generation and backbone knowledge distillation","venue":"cs.CV","work_id":"b037d73d-7476-4190-b815-c56b063ac3ea","year":2023},"citing_paper":{"arxiv_id":"2506.10172","last_updated":"2025-06-11T20:51:58Z","snapshot_observed_at":"2026-08-07T04:30:19.291758Z","submitted_at":"2025-06-11T20:51:58Z","title":"A Navigation Framework Utilizing Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:44.106715Z"},"links":{"cited_paper":"/paper/2301.12739","citing_paper":"/paper/2506.10172"},"observation_digest":"sha256:4485e2f9d7030ba82e944bf9fd556891af6119fdbabf88ada09b1ea07571c421","observation_id":"c9d96a78-ad85-4a4c-ad37-2c7d4daa377d","resolution":{"observed_at":"2026-08-07T04:35:44.175007Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:35:44.275259Z","title":"Mapnav: A novel memory represen- tation via annotated semantic maps for vlm-based vision- and-language navigation","venue":null,"work_id":"c8561d1a-1bf3-45c8-8a46-bf3d732d28cb","year":2024},"citing_paper":{"arxiv_id":"2506.10172","last_updated":"2025-06-11T20:51:58Z","snapshot_observed_at":"2026-08-07T04:30:19.291758Z","submitted_at":"2025-06-11T20:51:58Z","title":"A Navigation Framework Utilizing Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:44.109946Z"},"links":{"citing_paper":"/paper/2506.10172"},"observation_digest":"sha256:d1c583b33f1503e9b90b8d8b4edd39e3b7848091f147d754bc1da1c3c5907449","observation_id":"2efebbbf-7dd9-4d39-94e4-4d1d694df264","resolution":{"observed_at":"2026-08-07T04:35:44.278301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04031","last_updated":"2023-11-08T01:53:31Z","snapshot_observed_at":"2026-08-11T04:41:55.807344Z","submitted_at":"2023-06-06T21:49:00Z","title":"Certified Deductive Reasoning with Language Models","version":2},"cited_work":{"arxiv_id":"2306.04031","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.04031","snapshot_observed_at":"2026-08-07T04:35:44.160022Z","title":"Certified Deductive Reasoning with Language Models","venue":"cs.AI","work_id":"78ccee28-e90f-4a39-ad8b-90a1f89a4462","year":2023},"citing_paper":{"arxiv_id":"2506.10172","last_updated":"2025-06-11T20:51:58Z","snapshot_observed_at":"2026-08-07T04:30:19.291758Z","submitted_at":"2025-06-11T20:51:58Z","title":"A Navigation Framework Utilizing Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:44.112895Z"},"links":{"cited_paper":"/paper/2306.04031","citing_paper":"/paper/2506.10172"},"observation_digest":"sha256:8ffc3dae299cdbca33a5291c3b290f5ed6c1de92d43b6a19bbce012c42f1876a","observation_id":"152ad8c4-6154-422c-8ff9-2bacbb4c0391","resolution":{"observed_at":"2026-08-07T04:35:44.163249Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15740","last_updated":"2023-05-25T05:42:58Z","snapshot_observed_at":"2026-08-10T00:48:36.249306Z","submitted_at":"2023-05-25T05:42:58Z","title":"MPE4G: Multimodal Pretrained Encoder for Co-Speech Gesture Generation","version":1},"cited_work":{"arxiv_id":"2305.15740","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15740","snapshot_observed_at":"2026-08-07T04:35:44.145415Z","title":"MPE4G: Multimodal Pretrained Encoder for Co-Speech Gesture Generation","venue":"cs.CV","work_id":"7f5aedc1-ef25-4025-ad90-8c184ed43b9e","year":2023},"citing_paper":{"arxiv_id":"2506.10172","last_updated":"2025-06-11T20:51:58Z","snapshot_observed_at":"2026-08-07T04:30:19.291758Z","submitted_at":"2025-06-11T20:51:58Z","title":"A Navigation Framework Utilizing Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:44.116335Z"},"links":{"cited_paper":"/paper/2305.15740","citing_paper":"/paper/2506.10172"},"observation_digest":"sha256:57a6dd16d5de1e1c8ed9b34c92be73601efc207abd9223371cecc504e99b8698","observation_id":"19bb3a7b-f60b-43ea-9941-1923827e6e34","resolution":{"observed_at":"2026-08-07T04:35:44.150653Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.10172","last_updated":"2025-06-11T20:51:58Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T04:30:19.291758Z","submitted_at":"2025-06-11T20:51:58Z","title":"A Navigation Framework Utilizing Vision-Language Models"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2506.10172."}