{"as_of":"2026-08-08T11:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:129dace46d671be98c6336956271f131281723bd26aaee7a7fcbfe62a9dd1e43","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:12:12.349149Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T23:02:14.913189Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T23:02:52.667737Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"cited_work":{"arxiv_id":"2506.08566","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08566","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2506.08566","venue":null,"work_id":"cd04e37c-e6f4-42ff-bdf3-9608096a10af","year":null},"citing_paper":{"arxiv_id":"2508.09547","last_updated":"2026-04-29T01:36:59Z","snapshot_observed_at":"2026-07-06T22:12:12.166886Z","submitted_at":"2025-08-13T07:05:17Z","title":"GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T23:02:14.913189Z"},"links":{"cited_paper":"/paper/2506.08566","citing_paper":"/paper/2508.09547"},"observation_digest":"sha256:787dea5b755338dac88375fba370c7af7e565eb1391c4111f5e15b9398202516","observation_id":"134c4ef6-5447-4a21-bc5c-649dbd55a063","resolution":{"observed_at":"2026-05-18T23:02:52.670999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08566/citation-record","integrity":"/paper/2506.08566/integrity","json":"/paper/2506.08566/citation-record.json","paper":"/paper/2506.08566"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.021740Z","title":"Spatio- temporal dynamics and semantic attribute enriched visual encoding forvideocaptioning,in:CVPR,pp.12487–12496","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.021740Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:0fbe1353848a936aa5e0fed5e3228741c99c51b45cbc738a0cac3a5a75e5538d","observation_id":"4b4c694c-d47f-4296-a2a7-f1778dedafb3","resolution":{"observed_at":"2026-08-07T05:12:12.021740Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.027146Z","title":"Bottom-up and top-down attention for image captioningandvisualquestionanswering,in:CVPR,pp.6077–6086","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.027146Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:5a368769dcd5f268a1c32d336f24cbc0ab5db2361e4f15ac5ec267e72d3f2420","observation_id":"96807f12-72d1-4b10-ae32-2c537c85d637","resolution":{"observed_at":"2026-08-07T05:12:12.027146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.032305Z","title":"Vision- and-language navigation: Interpreting visually-grounded navigation instructions in real environments, in: CVPR, pp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.032305Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:70a74a3ea5fed3e92f57afb047a6b069cb917dc3be248969bda616c32984b122","observation_id":"eacef57d-aabb-412c-a4c9-80b3bdc53d23","resolution":{"observed_at":"2026-08-07T05:12:12.032305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5403.12254","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.067979Z","title":"NLTK: the natural language toolkit, in: Calzolari, N., Cardie, C., Isabelle, P","venue":null,"work_id":"0b6af80c-729c-4c6f-b9a2-666f8f5b242d","year":2006},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.036976Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:742e4fa62240a76647ca818c8e978e7e161724d352e5294627d18d66e8baf05b","observation_id":"a2ccec0e-972c-4408-81c0-c0f9a75152c0","resolution":{"observed_at":"2026-08-07T05:12:14.075459Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.649797Z","title":"Matterport3d: LearningfromRGB-Ddatainindoorenvironments,in:3DV,pp.667–","venue":null,"work_id":"d7377aa4-d038-4a93-bd68-ca35573e11ab","year":2017},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.041272Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:e514a5980385f3740a441c56b0735672b5a2894f6f2bd4a3ba694e43bad67d1b","observation_id":"34cf6f45-2840-4dc4-8083-16501565f751","resolution":{"observed_at":"2026-08-07T05:12:14.654668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.050547Z","title":"TOUCH- DOWN: natural language navigation and spatial reasoning in visual street environments, in: CVPR, pp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.050547Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:69658f6bd62cfeb771f10ce93d83d17711f78376e40f81cd174fff15d46c8137","observation_id":"9ac936c7-125b-458d-b108-78302e980c76","resolution":{"observed_at":"2026-08-07T05:12:12.050547Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.635708Z","title":"Historyawaremul- timodaltransformerforvision-and-languagenavigation,in:NeurIPS, pp","venue":null,"work_id":"09f7c4af-2fd1-4f09-8d8e-91836c658264","year":2021},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.055232Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:80515be0b68bd4fc17f10b9c0c4fddcab8a378f332711d56f9f4f613907628f5","observation_id":"4c521f32-b680-4250-a58c-cdfd0af18af6","resolution":{"observed_at":"2026-08-07T05:12:14.641035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.059807Z","title":"Learning from unlabeled 3d environments for vision-and-language navigation,in:ECCV,pp.638–655","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.059807Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:a3e066d9859f101d3373658cbf5a2978bc9537801530d3682c511f1c78bdb02b","observation_id":"72778319-bebe-4dcc-9303-e3e108bda61f","resolution":{"observed_at":"2026-08-07T05:12:12.059807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.622796Z","title":"Unifying vision-and- language tasks via text generation, in: ICML, pp","venue":null,"work_id":"d37f697c-afc8-41cb-ab76-6a4ae08e9ac5","year":2021},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.068175Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:8e3e5efa5a1e2f3576b3dd8012eca32bbeb1556c14f81777f5739db32aabcd39","observation_id":"4800851c-3b88-4622-9bab-b5fd9a8a98b2","resolution":{"observed_at":"2026-08-07T05:12:14.627226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.072754Z","title":"Auxiliary fine-grained alignment constraints for vision-and-language navigation, in: ICME, pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.072754Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:7b7f4142ea926e60c1288fa6296a9c26bd10dca050f3a78923bd2c4f802c94f2","observation_id":"c0100153-0501-4fb7-a125-7fce788e1b16","resolution":{"observed_at":"2026-08-07T05:12:12.072754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.608830Z","title":"Meteor universal: Language specifictranslationevaluationforanytargetlanguage,in:Proceedings of the Ninth Workshop on Statistical Machine Translation, pp","venue":null,"work_id":"7c36eda5-3107-4b80-916b-42ec7e735cad","year":2014},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.081842Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:bd3b51c073c7214ca4152d63b0325892c255d41da7eae894ba96f831f16de272","observation_id":"88915f0b-fdae-43db-8e09-6efb5b734a8c","resolution":{"observed_at":"2026-08-07T05:12:14.613994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/34.982903","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.512912Z","title":"Visionformobilerobotnavigation: A survey","venue":null,"work_id":"df9bc9bf-90fd-4aee-b1b2-6277220d6798","year":2002},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.090129Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:0ae4302320a69c2507402ae37cf5b31249707da45d446dee1d11802d0ab9f315","observation_id":"e6f20fcc-cd24-44e8-b6f8-e65156778454","resolution":{"observed_at":"2026-08-07T05:12:12.517455Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.094146Z","title":"Aerial vision-and-dialog navigation, in: Findings of the Association forComputationalLinguistics,pp.3043–3061.doi:10.18653/V1/2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.094146Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:caa59cd7d3f3be91222d4f7f2016dc885551f717e1734a3985a1cc32b04c1dbf","observation_id":"ea206fc4-b2f1-43d0-9691-7a816cbfdb65","resolution":{"observed_at":"2026-08-07T05:12:12.094146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1613/jair.1.13646","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.491367Z","title":null,"venue":null,"work_id":"4028499f-8a41-470b-8d2b-5af4e0353ec7","year":2022},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.098369Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:41e3a0076f27a73cd5a3dcffd5152593850d2414b7753631bebcc92ee4f2dc3d","observation_id":"8da7b90f-f272-4703-9169-ab8ce3500280","resolution":{"observed_at":"2026-08-07T05:12:12.495451Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.595367Z","title":"Speaker-follower models for vision-and-language navigation, in: NeurIPS, pp","venue":null,"work_id":"33e3eea2-0ebb-4817-b765-c02a3e973f23","year":2018},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.102791Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:16d9b4f25ab49bf29d38af550e16616c2e855e5c2eb0d5299ffd529c2097f6f1","observation_id":"3689e419-a13b-4ab2-b2af-a6f0384b1ffc","resolution":{"observed_at":"2026-08-07T05:12:14.599570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.111576Z","title":"Vision- and-language navigation: A survey of tasks, methods, and future directions, in: ACL, pp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.111576Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:8061860a349afb4e72f073ad08a621ccd3ffcd46b9b511fe34907c8de7de3ccc","observation_id":"025a00c6-43d4-4456-aa90-5ecf5772357c","resolution":{"observed_at":"2026-08-07T05:12:12.111576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.582144Z","title":"Landmark-rxr: Solving vision-and-language naviga- tion with fine-grained alignment supervision, in: NeurIPS, pp","venue":null,"work_id":"c92e3ae3-6617-4d0b-982c-4edc75af9270","year":2021},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.124012Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:0d267e6e4427dbfc31c44841116087f3a2dd043f20267be0e4f92026adf92c05","observation_id":"752621a0-ee27-464f-9529-1c43697b88c4","resolution":{"observed_at":"2026-08-07T05:12:14.586568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.568223Z","title":"Lan- guage and visual entity relationship graph for agent navigation, in: NeurIPS","venue":null,"work_id":"8d54c996-f165-45b3-8810-eedfc0593eef","year":2020},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.128097Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:2727f166e045ae3f0c06f7da6fe36b90c43f9f5e2c7855efc2dbd6740870aaec","observation_id":"8d989065-f2ba-40ba-97dd-c59da456644d","resolution":{"observed_at":"2026-08-07T05:12:14.572587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.emnlp-main.271","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.469250Z","title":"Sub-instruction aware vision-and-language navigation, in: EMNLP, pp","venue":null,"work_id":"e3c09daa-1e97-4109-a8d3-a97a53fc12a2","year":2020},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.132307Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:3385a64d774e132334d31f4716cd2b8d6aafcba4979b92f8ccdeed8799dbd7a2","observation_id":"966cfa01-4b5d-4b6f-98cb-97e5af460351","resolution":{"observed_at":"2026-08-07T05:12:12.473819Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.136388Z","title":"VLNBERT: Arecurrentvision-and-languageBERTfornavigation,in:CVPR,pp","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.136388Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:171b13d05c4c6e32df0d6db1cc416e74ce2abdaade123301aed4d2258dcee305","observation_id":"5ea3fefe-2247-452c-847e-f97c09506236","resolution":{"observed_at":"2026-08-07T05:12:12.136388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.140285Z","title":"Transferable representation learning in vision-and- language navigation, in: ICCV, pp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.140285Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:73db8bc0147515e858f1780a1522d2d6d85b1b0082b6c7d22bd84039b7fa6a64","observation_id":"76cec562-f291-462e-a3fd-11258133fb05","resolution":{"observed_at":"2026-08-07T05:12:12.140285Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.149291Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.149291Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:daa1b63d59ff725c4176890455f41c8899f54baca07cf84fa57fad0146e0636c","observation_id":"d90a169e-7aca-4fc8-a8c3-7a16064af85c","resolution":{"observed_at":"2026-08-07T05:12:12.149291Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.554744Z","title":"Simple and effective synthesisofindoor3dscenes,in:AAAI,pp.1169–1178","venue":null,"work_id":"545533b0-250d-4e35-82f1-dc784f897e70","year":2023},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.153917Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:6d42a1b8c1152a6bbaeb617ef1f329414ac26a951ad0b54938e728db9eb91ace","observation_id":"aaae132a-7902-4e99-9330-79976e2d8237","resolution":{"observed_at":"2026-08-07T05:12:14.559165Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.01488","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:13.254382Z","title":"Waypoint models for instruction-guided navigation in continuous environments, in: ICCV, pp","venue":null,"work_id":"e47285b2-3cc0-469b-947f-ed6f24880725","year":2021},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.161951Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:9984c879d82f10d28d930290c5770fe93818f2d831a8c10a60259a201d00a4fa","observation_id":"6057cf87-c913-48cb-8dda-9a4383e98b0a","resolution":{"observed_at":"2026-08-07T05:12:13.262137Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.540921Z","title":"Room- across-room:Multilingualvision-and-languagenavigationwithdense spatiotemporalgrounding,in:EMNLP,pp.4392–4412.doi:10.18653/ v1/2020.emnlp-main.356","venue":null,"work_id":"9c49c960-108c-4c1d-ae4e-db873f500c2e","year":2020},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.167048Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:45dc87bd0fe588b0338d7a52ebea21b2f1ef1192aea8170355791358b3da0550","observation_id":"f1893db0-14cf-41a9-a385-1fb30c8d9fcc","resolution":{"observed_at":"2026-08-07T05:12:14.545422Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v34i07.6795","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.446804Z","title":"Unicoder- vl: A universal encoder for vision and language by cross-modal pre- training, in: AAAI, pp","venue":null,"work_id":"cab8205c-d11a-47a3-89dd-6749ef57b809","year":2020},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.171799Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:70898d3369850ae02b2ef9c4bdd10eaec55f80f5e93a26c422120cfd3d3c926d","observation_id":"7cbc4aa2-365c-4f2b-842e-70b1e23089ef","resolution":{"observed_at":"2026-08-07T05:12:12.451747Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.527533Z","title":"Panogen: Text-conditioned panoramic envi- ronment generation for vision-and-language navigation, in: NeurIPS","venue":null,"work_id":"c8c89ccc-4e00-491d-972f-2463902882f1","year":2023},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.175858Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:1f532cfa5fc1b133567ca8b0cc990202272b8e28b60e47e2048f2d6986e24f7b","observation_id":"8be528bc-5df8-494e-98d0-835d505db6f9","resolution":{"observed_at":"2026-08-07T05:12:14.532183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.184569Z","title":"KERM: knowledge enhanced reasoning for vision-and-language navigation, in: CVPR, pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.184569Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:3338c21f8aff8b09e4646bc5e457575eb3d2dad3aa82015b5feb31abac10a6bb","observation_id":"dac5984a-7651-4248-a27b-e5b54a09d0e3","resolution":{"observed_at":"2026-08-07T05:12:12.184569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.513894Z","title":"ROUGE: A package for automatic evaluation of summaries,in:TextSummarizationBranchesOut,Barcelona,Spain","venue":null,"work_id":"afc03a13-cc60-4719-bb87-b02c71d95592","year":2004},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.188385Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:710f9b3c388cfe52afe3e11c59f8f48b86d37c7dd317f2147ba23f3b28046388","observation_id":"214a6609-ca0c-460b-8f6d-37c8d98f1a0e","resolution":{"observed_at":"2026-08-07T05:12:14.518389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.192628Z","title":"Learning vision-and-language navigation from youtube videos, in: CVPR, pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.192628Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:d96bac2b281973dbf6aba50c5eb188d28d574c5da4b83fbf5f413e679d04488d","observation_id":"f485b723-0a93-459b-837d-0e5adc672e0f","resolution":{"observed_at":"2026-08-07T05:12:12.192628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.501242Z","title":"Self-monitoring navigation agent via auxiliary progress estimation, in: ICLR","venue":null,"work_id":"511d6430-bf66-452d-b57f-8ec21388c3e2","year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.200454Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:c5422d09965e89b702ae82714bd8c236d75e2915379263ceb019cc4e84bce6e5","observation_id":"8794a4ed-015e-4f2b-a699-0e8aee49458f","resolution":{"observed_at":"2026-08-07T05:12:14.505709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.00689","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:13.173394Z","title":"Theregretful agent: Heuristic-aided navigation through progress estimation, in: CVPR, pp","venue":null,"work_id":"81743424-9e07-4426-851d-8cd36225b48d","year":2019},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.204524Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:88b33b719c1bc40e4e38172abf631f5518559ad84b705b2062a9a43817adfcb2","observation_id":"65b1f3e3-261b-4320-9e2d-0ed0cfd45906","resolution":{"observed_at":"2026-08-07T05:12:13.181081Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.487807Z","title":"Improving vision-and-language navigation with image-text pairs from the web, in: ECCV, pp","venue":null,"work_id":"f2f6b696-5008-4077-9a72-50a9ee4d46fd","year":2020},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.208375Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:9b1f18b417fe3b600cd13cd88f8b7942d401295a930c4a92ea8ef1eef731f41a","observation_id":"0187b010-9da3-4203-82d9-cbc16ca6e155","resolution":{"observed_at":"2026-08-07T05:12:14.492370Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.474006Z","title":"SOAT: A scene- and object-aware transformer for vision-and-language navigation, in: NeurIPS, pp","venue":null,"work_id":"79ca4330-fcde-4b38-b906-48e4c165e344","year":2021},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.212340Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:c3b0341f3d6348cce93ecc0893efde3f4e5d4dcabc62a0c4247503ffda82fa66","observation_id":"d50d4463-a269-43cd-9579-b13975f35f18","resolution":{"observed_at":"2026-08-07T05:12:14.478509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.220240Z","title":"Bridging the visual semantic gapinVLNviasemanticallyricherinstructions,in:ECCV,pp.54–69","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.220240Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:cbfc0640bf7c4d1c790e69e724525dbe47a4e9c03ed9510bc12140efa47d4c23","observation_id":"9396e758-f39a-412f-bd9a-ccae3a5eaafa","resolution":{"observed_at":"2026-08-07T05:12:12.220240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.446299Z","title":"Teach: Task-driven embodied agents that chat, in: AAAI, pp","venue":null,"work_id":"4ab69444-7ffd-4455-8018-369a53361a1f","year":2022},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.224781Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:491175db6e319ee4e6f2284720c6fcd8ffe2d56245aca6a26701fd40f3f1923f","observation_id":"b2052fa8-2f1e-4b64-8f95-d40c067ac602","resolution":{"observed_at":"2026-08-07T05:12:14.450898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.235094Z","title":"Bleu: a method for automatic evaluation of machine translation, in: Proceedings of the 40th Annual Meeting of the Association for Computational Lin- guistics, pp","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.235094Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:217c615485760f2d0224391b27e99f35627a7aaaa8fa96151ef9ec5316c47324","observation_id":"88509fdc-81c0-4ebc-bac5-551fa243ac51","resolution":{"observed_at":"2026-08-07T05:12:12.235094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.432173Z","title":"The road to know-where: An object-and-room informed sequential BERT for indoor vision-language navigation, in: ICCV, pp","venue":null,"work_id":"28817cba-241b-41a7-8443-3826b9e6e934","year":2021},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.239091Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:f94e0e158813c320654836a84b5de28b78c8a1a82774f06afd724e0baeb26226","observation_id":"661964f5-77b7-4b2e-9318-550233c04d4a","resolution":{"observed_at":"2026-08-07T05:12:14.436917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-58607-2","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":"Object- and-actionawaremodelforvisuallanguagenavigation,in:ECCV,pp","venue":"Lecture notes in computer science","work_id":"a23fc7fb-76cd-432c-837f-fd0d20e29fc9","year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.247499Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:7830fcebb39a204cbd443ebedeef096c7bb57e84c6213bb955f94df8390ec154","observation_id":"23b9ec66-062c-4738-82ce-742964fb1c6c","resolution":{"observed_at":"2026-08-07T05:12:12.419946Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.256573Z","title":"HOP+: history-enhanced and order-aware pre-training for vision- and-language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.256573Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:9faf890826362e1e25feaf3f43e6532d11d5ea1eae582f64f085a5a79756cccf","observation_id":"2c28b650-edb2-45fc-bfd5-f82a69f624fe","resolution":{"observed_at":"2026-08-07T05:12:12.256573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.416381Z","title":"Learningtransferablevisualmodelsfromnatural language supervision, in: ICML, pp","venue":null,"work_id":"11b3df2f-daa0-4458-9abe-71424d177940","year":2021},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.260608Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:7d9c0ba95f2f3211b6380a4f50dd72f9c8ddabe02c14a73432aafef6f4dc4d10","observation_id":"615a9ec6-fb64-4bf0-b055-d42276909213","resolution":{"observed_at":"2026-08-07T05:12:14.422608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.402543Z","title":"Towards long-horizon vision-language navigation: Platform, benchmark and method, in: CVPR","venue":null,"work_id":"2eab033c-1229-4e09-ac02-47cca2680b5b","year":2025},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.268752Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:32d17a49d03ca11a8c6331f841baac7cf6a488254b39db25b42f517a4d3f5987","observation_id":"0fea42e3-ee92-4f61-9f2a-ff3cf639a98c","resolution":{"observed_at":"2026-08-07T05:12:14.407526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.388438Z","title":"Contrastive search is what you need for neuraltextgeneration","venue":null,"work_id":"e595fa91-47f1-4d25-8634-f9181966356e","year":2023},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.272856Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:c478cf9579e6d794c359947b124670a185a7d358fbef7ef6369b7d4c3f9bc75c","observation_id":"bb77a352-9934-4565-ae53-20ebda4ace23","resolution":{"observed_at":"2026-08-07T05:12:14.393190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n19-1268","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.399073Z","title":"Learning to navigate unseen envi- ronments:Backtranslationwithenvironmentaldropout,in:NAACL- HLT, pp","venue":null,"work_id":"f430e3fa-1191-4a86-8cad-f5177277dc09","year":2019},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.277578Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:3a16332e76cea5f986830498a01dd629fa517d60174d8043d84471b41cb5e28b","observation_id":"aecb1bbf-1e92-4d93-933c-7851a130c470","resolution":{"observed_at":"2026-08-07T05:12:12.405485Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.374326Z","title":"Vision-and-dialog navigation, in: CoRL, pp","venue":null,"work_id":"d3754280-4cd5-44e5-a825-2a6c53cb9db5","year":2019},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.281829Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:9c479a823f0d7aa16823b8ba31105ba2c64a1fe120c249a6e701977505feff09","observation_id":"813c2439-0122-4ab6-935c-edc2581e9a80","resolution":{"observed_at":"2026-08-07T05:12:14.378885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.285974Z","title":"Cider: Consensus- based image description evaluation, in: CVPR, pp","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.285974Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:5fed213e40e83137d0d3895c7261ab44d442a692088cd4b74d1188fc17f6b50c","observation_id":"fa53d099-7623-4a10-9e7a-de62d4e3d867","resolution":{"observed_at":"2026-08-07T05:12:12.285974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.290006Z","title":"Show and tell: A neural image caption generator, in: CVPR, pp","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.290006Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:6fe6c9e1ff91c1026f12df57bf985566d09d16657b29f4a90e5cba887a6ffa9b","observation_id":"04a3101a-bf63-467a-b49b-d5e2dec4bf35","resolution":{"observed_at":"2026-08-07T05:12:12.290006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.358664Z","title":"Soft expert reward learning for vision-and-language navigation, in: ECCV, pp","venue":null,"work_id":"70c2718b-ddeb-44a1-b2a9-1d650855dea5","year":2020},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.298071Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:7bd624ed4817f935067c8a13b1b62d2ee1fbc7bf0b54ddeda67d6f3f5236645f","observation_id":"3ab685b3-0fb2-443e-b9da-57a4ddd0134d","resolution":{"observed_at":"2026-08-07T05:12:14.363551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.343337Z","title":"GIT: A generative image-to-text transformer for vision and language","venue":null,"work_id":"3286c898-540f-4a68-8238-fc60c76a1821","year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.303260Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:872f172ff0401b7f619a6374f045e5f68cb897df244f6191b6960d234b475089","observation_id":"225f25e8-056b-4056-9d25-f6a7a05c2bf7","resolution":{"observed_at":"2026-08-07T05:12:14.347964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.315853Z","title":null,"venue":null,"work_id":"f0d278a7-b27c-4c0f-ae17-262f23b5e639","year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.311490Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:ad9980eecba2424098925314e80a745297486a7e0fdeae054283dc44ddb711a0","observation_id":"341561be-031f-4fea-af60-01fe927b83a4","resolution":{"observed_at":"2026-08-07T05:12:14.320063Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.301784Z","title":"OFA: unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning frame- work, in: ICML, pp","venue":null,"work_id":"66b27334-8981-4c30-a360-96b27657583b","year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.319606Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:cfa3cc4ab15abdde6869ecb4f8c2fdc2af109d322d4b46cb5e07855721019ddf","observation_id":"63c57a3a-3ba8-4d14-8b8f-16d07ccc25f9","resolution":{"observed_at":"2026-08-07T05:12:14.306372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.323819Z","title":"Less is more: Generating grounded navigation instructions from landmarks, in: CVPR, pp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.323819Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:38ac6324dbca09781c2398cc524dfb7e5434d3aa413d834fe935ce5064e4e25f","observation_id":"0609499b-c5eb-4540-b01f-9e7fb8b15770","resolution":{"observed_at":"2026-08-07T05:12:12.323819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.00679","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.747815Z","title":"Reinforced cross-modal matching and self-supervised imitation learning for vision-language navigation, in: CVPR, pp","venue":null,"work_id":"e191d063-7890-4696-af27-49f988aa6881","year":2019},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.327661Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:415e8518b6af3c905979259ac4a93aa701a8ac49b75bd9d0ab07823e1cccbb65","observation_id":"9edd9f04-e220-4576-822d-f24e52c0f593","resolution":{"observed_at":"2026-08-07T05:12:12.756522Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.01826","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.670491Z","title":"LANA: A language- capablenavigatorforinstructionfollowingandgeneration,in:CVPR, IEEE","venue":null,"work_id":"df8a492f-3b72-42ea-8048-4d7ac5bf5c3b","year":2023},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.331590Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:4dd3af75f511c7f34aa5f182fb4e51a7e104c229979aa60ce9015d2d79867097","observation_id":"34bea04b-a9f1-4154-b860-46b8db0f2882","resolution":{"observed_at":"2026-08-07T05:12:12.677546Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.287221Z","title":"Show, attend and tell: Neural image :Preprint submitted to Elsevier Page 14 of 15 caption generation with visual attention, in: ICML, pp","venue":null,"work_id":"9710f336-868b-4b6d-a173-ae7eb22f2921","year":2015},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.336239Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:9d2c6b4c1c1dcebd2da227a6f3e8c8d61836f9d41577878b9580b3341a772322","observation_id":"3ac4d94b-438e-41ff-acfd-bbfae8db2b06","resolution":{"observed_at":"2026-08-07T05:12:14.292112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.340247Z","title":"Unified vision-language pre-training for image captioning and VQA, in: AAAI, pp","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.340247Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:a1b90353d108a957d1b06c0319fe77597906385835a7d00d0ebc8836b61f6df8","observation_id":"d4d4cf0d-a8ac-4376-9cf1-1a02599e6059","resolution":{"observed_at":"2026-08-07T05:12:12.340247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.345285Z","title":"Vision-language navigation with self-supervised auxiliary reasoning tasks, in: CVPR, pp","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.345285Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:47a87ddfb85c4f767590d2fa89e7a68661325464ff6e6b65c5cd1f29ca2ece58","observation_id":"6babf70e-4066-4e21-8f4c-c977d6cd47cd","resolution":{"observed_at":"2026-08-07T05:12:12.345285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.349149Z","title":"Babywalk:Goingfartherinvision-and-languagenavigationbytaking babysteps,in:ACL,pp.2539–2556","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.349149Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:ba59002977c4ab294467e3233bc3b19180ee6cea8f9d2e43a158b737081a4a1e","observation_id":"ca6b9874-9a29-4ed5-86d9-409884f01816","resolution":{"observed_at":"2026-08-07T05:12:12.349149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.085959Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":380,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.085959Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:8a203003e8246bb18328da64439e73b496cdf2e7cc19d079801e0a7e8eace595","observation_id":"026645a0-97a9-4a3b-9725-f08d96dcf612","resolution":{"observed_at":"2026-08-07T05:12:12.085959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.045804Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":676,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.045804Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:7c066d6d8916f69b18da4461972e7629aeeda0f28c804baeeabfcf78144d1377","observation_id":"b910639c-c43c-4e4b-b389-5cbba8e5a53d","resolution":{"observed_at":"2026-08-07T05:12:12.045804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.243135Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":1644,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.243135Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:ed1baf2f48a80beddab465e73cd42fe9a7495b1db67147cd2f0dd6e3b67d21d7","observation_id":"cf621fab-ba65-4bc6-a139-d8eb16438d01","resolution":{"observed_at":"2026-08-07T05:12:12.243135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.329586Z","title":null,"venue":null,"work_id":"521f9925-7dc1-4d55-af94-7a05d93cc5e3","year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.307332Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:5ac7bdaac123712f4ef25b88b5ad94a74392d4ef77fd7ebf038356c9bfad6710","observation_id":"538109e6-4675-4359-a24c-0044a6b7a330","resolution":{"observed_at":"2026-08-07T05:12:14.333845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.10748","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.823834Z","title":null,"venue":null,"work_id":"6b491218-ac93-458b-8042-c6657ab6e313","year":2023},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.315636Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:3ca59393539126fb83d848d24be20c299963b1ffca93aaa5c0bbefe9a8c760dd","observation_id":"160a8a3a-27e1-40c4-bc54-ab34e3c7420b","resolution":{"observed_at":"2026-08-07T05:12:12.830343Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.229720Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.229720Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:e69bfcdba50cdf7d0d2886968dd3c36a0826998e67893c2dbbd3c245926af53f","observation_id":"56374228-da84-4be0-885b-62f890fe8cef","resolution":{"observed_at":"2026-08-07T05:12:12.229720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.460333Z","title":null,"venue":null,"work_id":"76971512-d147-4e65-baca-95d661561ac9","year":2021},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":7367,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.216264Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:b228a3944fd2711932908d49af5583dece2611680ce5f4fc159b99955755944c","observation_id":"8fd95b62-9716-4c42-8769-55257bce25fb","resolution":{"observed_at":"2026-08-07T05:12:14.465023Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:04:54.679638Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":7,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":25,"verified_exact":10,"verified_fuzzy":21},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 1 inbound Pith citation observation for arXiv:2506.08566."}